GPT
A

Allegro

קוד פתוח

rhymes-aiapache-2.02024-10-16

  • diffusers
  • safetensors
  • text-to-video
  • en

מודל פתוח שמייצר קטעי וידאו מטקסט ברזולוציית 720p. הוא מתאים למי שמחפש פתרון עצמאי לייצור וידאו בלי תלות בספק חיצוני ובלי מגבלות רישוי מעיקות.

  • 2.8Bפרמטרים
  • 41.3 GBמשקל הקבצים
  • 898הורדות בחודש
  • 263לייקים

מה זה

מדובר במודל שמפיק סרטוני וידאו קצרים באורך 6 שניות מתוך תיאור טקסטואלי בלבד. הארכיטקטורה משלבת מקודד וידאו של 175 מיליון פרמטרים עם מודל דיפוזיה מסוג DiT של 2.8 מיליארד פרמטרים, מבנה שמאפשר להגיע לרמת פירוט טובה יחסית לגודלו. התוצר הגולמי יוצא בקצב של 15 פריימים לשנייה, והיוצרים ממליצים להשתמש במודל אינטרפולציה חיצוני כדי להכפיל את הקצב ל־30 פריימים לשנייה.

היתרון שלו מול מודלים כבדים בתחום הוא המשקל. עם פחות מ־3 מיליארד פרמטרים לרשת הראשית, הוא מנסה לתת מענה לתנועות מורכבות של בני אדם, בעלי חיים וסצנות דינמיות בלי להזדקק לחוות שרתים ענקית. אורך ההקשר עומד על 79.2K טוקנים, שמתרגמים ישירות ל־88 פריימים של וידאו.

מתאים ל

  • יצירת קטעי וידאו קצרים

    הפקה של סרטוני רקע באורך שש שניות וברזולוציית 720p מתוך תיאור טקסטואלי באנגלית.

  • בדיקות ופיתוח וידאו מקומי

    ניסויים ביצירת וידאו על חומרה עצמאית ללא עלויות קריאה לשרתים חיצוניים.

  • שילוב במערכות יצירת תוכן

    בניית שירותי עריכה ומדיה בזכות רישיון מסחרי פתוח שאינו מגביל שימוש מסחרי.

איפה זה נופל

הקצב המקורי נמוך ועומד על 15 פריימים לשנייה בלבד, מה שמחייב עיבוד נוסף עם כלי חיצוני כדי לקבל תנועה חלקה באמת. בנוסף, המודל מאומן על אנגלית בלבד, כך שאי אפשר להזין לו הנחיות בעברית ולקבל תוצאה הגיונית. ההרצה על כרטיס בודד דורשת פשרות כואבות, שכן שימוש בזיכרון נמוך מאט מאוד את הקצב, ומקודד הווידאו דורש דיוק של FP32 לקבלת תוצאות טובות, מה שמעמיס עוד יותר על המערכת.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי?

כן, בתנאי שיש לכם לפחות 10 גיגה זיכרון בכרטיס ומפעילים מצב sequential_cpu_offload בקרב Diffusers. החיסרון הוא שזמן היצירה יתארך משמעותית כי המערכת תעביר משקלים בין המעבד לכרטיס המסך לכל אורך התהליך.

האם המודל מבין פרומפטים בעברית?

לא. המודל אומן ותומך בשפה האנגלית בלבד. אם תזינו טקסט בעברית המודל לא יבין את הבקשה, ולכן תצטרכו לתרגם את ההנחיות לאנגלית לפני שליחתן למודל.

איך מריצים

כדי להריץ אותו צריך פייתון 3.10 ומעלה, PyTorch 2.4 וגרסה עדכנית של diffusers. אם מריצים אותו בלי התאמות, תצטרכו לפחות 27.5 גיגה זיכרון בכרטיס המסך כדי להחזיק את המודלים במקביל. מי שמוכן לשלם בזמן ריצה יכול להפעיל CPU offload ולרדת לצריכת זיכרון גרפי של כ־9.3 גיגה במצב BF16, מה שמאפשר להריץ אותו גם על כרטיסים ביתיים חזקים יחסית.

המשקל של הקבצים עומד על מעל 41 גיגה, כך שההורדה הראשונית תיקח זמן. אם המטרה היא בדיקה מהירה של רעיון ולא בניית תשתית קבועה, עדיף לבדוק קודם את ההדגמות או שירותי צד שלישי, כי זמן היצירה המקומי עם פריקה למעבד הופך את התהליך לאיטי בצורה מורגשת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("rhymes-ai/Allegro")
img = pipe("a photo").images[0]

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר להשתמש במודל לפרויקטים מסחריים ופרטיים, לשנות אותו, לארח אותו או לשלב אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗