GPT
S

Self-Forcing

קוד פתוח

gdhe17apache-2.02025-06-09

  • self-forcing
  • text-to-video

מודל ליצירת וידאו מטקסט שמפיק פריימים ברצף בזמן אמת. הוא מיועד למי שרוצה ביצועי דיפוזיה מהירים על כרטיס גרפי ביתי חזק בלי לחכות דקות לכל סרטון.

  • 37.1 GBמשקל הקבצים
  • 6,916הורדות בחודש
  • 132לייקים

מה זה

המודל מבצע יצירת וידאו רציפה בגישה אוטורגרסיבית שמדמה את תהליך ההסקה כבר בזמן האימון, בשילוב שימור זיכרון של מפתחות וערכים. הוא נשען על פיתוחים קודמים כמו Wan2.1 וקוד ממיזם CausVid, ומטרתו לפתור את חוסר ההתאמה בין ההפצה באימון לבין מה שקורה בזמן הריצה בפועל.

בניגוד למודלים כבדים שמחייבים חוות שרתים כדי לפלוט שניות בודדות של וידאו, כאן הדגש הוא על קצב עבודה שמאפשר הזרמה רציפה. הוא כולל תמיכה בטכניקות האצה שונות כמו הידור מראש, שכבות לינאריות ברמת דיוק נמוכה יותר, ומנגנון דחיסה חלופי לתמונות שנועד להגביר את המהירות על חשבון חדות הווידאו.

מתאים ל

  • הזרמת וידאו מקומית בזמן אמת

    הוא מתוכנן לעבוד בקצב הזרמה על כרטיס בודד של 24 גיגה זיכרון בלי זמני עיבוד ארוכים.

  • אימון מודלים ללא דאטה של וידאו

    גרסת הדיסטילציה שלו מאפשרת אימון מבוסס טקסט בלבד ללא צורך בהחזקת מאגרי סרטונים.

  • מחקר של דיפוזיה רציפה

    הקוד פותר את פערי ההפצה בהסקה אוטורגרסיבית ומתאים לבדיקת שיטות דחיסה וזיכרון מטמון.

איפה זה נופל

הבעיה הבולטת ביותר היא הרגישות להוראות הטקסט. המודל מתקשה להפיק תוצאות סבירות מפרומפטים קצרים, ותוכנן לעבוד רק מול תיאורים ארוכים ומפורטים מאוד. כרגע אין במערכת מנגנון מובנה שמרחיב את הטקסט בעצמו, כך שחובה להעביר את ההנחיות דרך מודל שפה חיצוני לפני ששולחים אותן אליו.

מעבר לזה, ניסיונות לחלץ ממנו ביצועים מהירים יותר בעזרת שכבות FP8 או רכיב VAE חלופי מובילים לפגיעה מורגשת באיכות התמונה. גם התאימות נבדקה על תצורות חומרה מצומצמות מאוד של אנבידיה, כך שכל סביבה אחרת עלולה להיתקל בבעיות.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי רגיל?

לא. המודל דורש מערכת הפעלה לינוקס, לפחות 64 גיגה של זיכרון ראם וכרטיס מסך חזק של אנבידיה עם 24 גיגה זיכרון ייעודי לפחות, כמו RTX 4090. חומרה חלשה יותר לא נתמכת רשמית ולא תעמוד בדרישות הזיכרון.

האם המודל מבין פרומפטים קצרים ופשוטים?

הוא לא עובד איתם טוב. המודל אומן על תיאורים ארוכים ומפורטים, וכדי לקבל תוצאות תקינות צריך להשתמש במודל שפה חיצוני שירחיב ויפרט את הפרומפט לפני שליחתו.

האם חייבים להוריד קבצים נוספים מעבר למשקלים בעמוד?

כן. הקוד דורש גם את משקלי הבסיס של המודל Wan2.1-T2V-1.3B כדי לפעול, כך שיש להוריד אותם בנפרד בהתאם להוראות ההפעלה.

איך מריצים

בשביל להריץ את המודל צריך מחשב לינוקס עם לפחות 64 גיגה זיכרון עבודה, וכרטיס מסך של אנבידיה עם 24 גיגה זיכרון לפחות. היזמים בדקו אותו על גבי כרטיסי RTX 4090, A100 וגם H100. ההתקנה דורשת סביבת פייתון ייעודית והתקנת חבילות כמו flash-attn, יחד עם הורדת משקלי הבסיס של Wan2.1-T2V-1.3B בנוסף לקובצי המודל עצמם.

ההרצה מתבצעת מסקריפט פקודה או ממשק הדגמה גרפי. אם אין ברשותכם חומרה פיזית ברמה הזו או שאין לכם צורך בתהליך מקומי שדורש הורדה של עשרות גיגהבייטים, הפעלה מקומית תהיה יקרה ומסורבלת, ובמצב כזה עדיף לפנות לשירותי ענן שמנגישים מודלים מוכנים.

pip install -U huggingface_hub
hf download gdhe17/Self-Forcing

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי בקוד ובמשקלים לצרכים אישיים ומסחריים. אפשר לשנות את המודל, לשלב אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, בתנאי ששומרים על הודעות זכויות היוצרים וההצהרות המקוריות של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗