GPT
T

tokenflow

רץ בדפדפן

weizmannscienceרישיון לא דווח2023-08-28

  • gradio

עריכת סרטוני וידאו קצרים בעזרת הנחיות טקסט, תוך שמירה על התנועה המקורית. הכלי מתאים לחוקרים ויוצרים שרוצים לבדוק עריכת וידאו מבוססת דיפוזיה בלי לאמן מודל מאפס.

  • הורדות בחודש
  • 173לייקים

מה זה

אתם מעלים סרטון קיים וכותבים תיאור טקסטואלי של מה שתרצו לראות בתוצאה, לצד הנחיה שמגדירה את תוכן המקור. המערכת מפרקת את הקובץ לפריימים, מבצעת תהליך היפוך של הדיפוזיה, ומייצרת סרטון חדש שבו הדמויות או הסגנון משתנים בהתאם לטקסט תוך שמירה על מבנה התנועה.

מתחת למכסה רץ המודל Stable Diffusion 2.1 Base לצד תמיכה במודלים נוספים ממשפחת סטייבל דיפיוז'ן וקונטרול-נט. העיקרון של טוקנפלו מבוסס על שיתוף תכונות פנימיות בין הפריימים השונים בזמן הדגימה כדי למנוע ריצודים, יחד עם שימוש בפרמטרים של Plug-and-Play לשליטה ברמת תשומת הלב של המודל.

בדוגמאות המוכנות מראש אפשר למצוא קטעים של זאב, אישה רצה, חיתוך לחם וכלב בריצה. הן מציגות בעיקר החלפה סגנונית של מושא הצילום או הרקע בסרטונים עם תנועה ברורה ומוגדרת היטב.

מתאים ל

  • החלפת סגנון לדמויות בתנועה

    שינוי מראה של אדם או חיה בסרטון קצר באמצעות תיאור טקסט חדש, בלי לאבד את התנועה.

  • בדיקת יכולות עקביות בדיפוזיה

    השוואת ביצועים של היפוך פריימים ומעקב אחר ריצודים בסרטונים מורכבים.

  • ניסויי Plug-and-Play בווידאו

    כוונון ספי תשומת לב ותכונות כדי לבחון כמה המבנה המקורי נשמר מול ההנחיה החדשה.

איפה זה נופל

הבעיה המרכזית כרגע היא שהאפליקציה במצב מושהה ולא פעילה ישירות. מעבר לזה, עיבוד וידאו מלא על בסיס מודל תמונה מחייב פשרות. אם תעלו סרטון ארוך או תדרשו מספר פריימים גבוה, המשאבים יגבילו אתכם או שהעיבוד יקרוס.

ההדגמות בעמוד מציגות סרטונים קצרים ופשוטים יחסית. בסרטונים עם תנועות מצלמה חדות או שינויי תאורה מהירים, קשה מאוד לשמור על עקביות ולמנוע עיוותים בין פריים לפריים.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם עכשיו?

האפליקציה עצמה חינמית, אבל כרגע היא במצב מושהה. כדי להשתמש בה תצטרכו לשכפל את המרחב לחשבון שלכם ולהקצות לו חומרה גרפית, מה שעשוי לדרוש תשלום על זמן ענן. אם אין לכם חומרה כזו, הממשק פשוט לא יעבוד.

כמה זמן לוקח לייצר סרטון ערוך?

זה תלוי במספר הפריימים ובצעדי הדיפוזיה שתבחרו באפשרויות המתקדמות. על מעבד A10G עיבוד של שניות בודדות עם כמה עשרות פריימים לוקח בדרך כלל כמה דקות. אם תעלו את מספר הפריימים למקסימום, זמן ההמתנה יתארך משמעותית.

מה קורה לקובצי הווידאו שאני מעלה לממשק?

הקבצים מועלים לשרתי האגינג פייס שבהם מותקן המרחב, ומעובדים שם מקומית בזיכרון המכונה. מאחר שהרישיון ותנאי השימוש הספציפיים של המרחב לא מוגדרים, לא מומלץ להעלות חומרים רגישים או פרטיים. עדיף להסתפק בקטעים לניסוי שאין בעיה שייחשפו.

במה הממשק הזה שונה מסתם להריץ סטייבל דיפיוז'ן על כל פריים?

אם מריצים מודל תמונה רגיל פריים אחרי פריים, מקבלים סרטון שמרצד בלי הפסקה כי כל תמונה מיוצרת מחדש בלי קשר לקודמתה. הכלי כאן מיישם את שיטת TokenFlow שמקשרת את התכונות הפנימיות בין הפריימים לאורך הזמן. התוצאה היא וידאו חלק ועקבי בהרבה.

איך משתמשים

טוענים קובץ וידאו, מקלידים את שורת הפקודה ולוחצים על Edit your video. למי שרוצה לשלוט בפרטים, יש לשונית אפשרויות מתקדמות שבה מכוונים את כמות הפריימים בין 2 ל־200, קצב הפריימים לשנייה, וצעדי ההיפוך והדיפוזיה.

כרגע העמוד מוגדר במצב מושהה בהאגינג פייס, מה שאומר שאי אפשר להריץ אותו מיד בדפדפן בלי להפעיל אותו מחדש. במקור הוא הוגדר לרוץ על מעבד גרפי מסוג Zero-A10G, חומרה שמסוגלת לבצע את החישובים אבל עיבוד של עשרות פריימים בדיפוזיה כבדה דורש המתנה מורגשת של כמה דקות.

הרישיון

הרישיון של המרחב לא דווח בקוד או בהגדרות. במצב כזה אין אישור שימוש מסחרי מוגדר, וצריך להניח שהקוד וההדגמה מיועדים למחקר והתנסות בלבד. קובצי הווידאו שאתם מעלים עוברים דרך השרתים שמארחים את הממשק.

הרישיון המלא ב־Hugging Face ↗