GPT
M

mochi-1-preview

קוד פתוח

genmoapache-2.02024-10-22

  • diffusers
  • safetensors
  • video
  • genmo
  • text-to-video

מודל פתוח שמייצר וידאו מטקסט עם עשרה מיליארד פרמטרים. הוא מיועד למי שרוצה שליטה מלאה על המשקלים ותנועה טבעית, בלי להיות תלוי בשירותים סגורים.

  • 10Bפרמטרים
  • 124 GBמשקל הקבצים
  • 3,223הורדות בחודש
  • 1,358לייקים

מה זה

מדובר במודל Text-to-Video מבוסס ארכיטקטורת Diffusion Transformer אסימטרית, שאומן מאפס כדי לחבר בין טוקנים של טקסט לטוקנים של וידאו. הרעיון המרכזי בארכיטקטורה הזו הוא חלוקת משאבים לא שווה, זרם הראייה מקבל כמעט פי ארבעה יותר פרמטרים בהשוואה לעיבוד הטקסט, שנעשה דרך מודל T5 יחיד. זה חוסך זיכרון חישובי בלי לפגוע בהבנת הפרומפט.

לצד מודל הדיפוזיה יש כאן רכיב VAE שמכווץ את הווידאו ביחס של פי 128 במרחב ובזמן לתוך מרחב לטנטי של 12 ערוצים. השילוב הזה נותן למודל יתרון מובהק בהיצמדות להוראות טקסטואליות מורכבות וביצירת תנועה חלקה ואמינה, תחום שבו רוב המודלים הפתוחים עדיין מתקשים מול המערכות המסחריות.

מתאים ל

  • מחקר ופיתוח וידאו

    ארכיטקטורה גמישה ופתוחה לחלוטין שמתאימה לחוקרים שרוצים לאמן שכבות מותאמות או לשנות את מנגנון הדיפוזיה.

  • הפקת קליפים פוטוריאליסטיים

    יצירת שוטים קצרים ומציאותיים לפרויקטים שבהם תנועת המצלמה והאובייקטים חייבת להיראות טבעית.

  • סביבות רינדור מקומיות

    הטמעה בתוך תהליכי עבודה פרטיים עם שרתי H100 מקומיים עבור חברות שלא יכולות להוציא נתונים לענן חיצוני.

איפה זה נופל

הרזולוציה הנוכחית מוגבלת ל־480p בלבד, כך שזה לא מתאים להפקות שדורשות חדות גבוהה בלי הגדלה חיצונית. המודל אומן בעיקר לסגנון פוטוריאליסטי ולכן נכשל לחלוטין בניסיון לייצר אנימציה, איורים או סגנונות מצוירים. במצבים של תנועה מהירה או קיצונית מופיעים עיוותים ומריחות בפריימים, והוא תומך בפרומפטים באנגלית בלבד ללא יכולת מובנית להבין עברית.

שאלות
נפוצות

האם המודל תומך בפרומפטים בעברית?

לא ישירות. מקודד הטקסט מבוסס על מודל T5 באנגלית בלבד, ולכן טקסט בעברית יפיק תוצאות שגויות או ריקות. חובה לתרגם את התיאור לאנגלית לפני השליחה.

האם אפשר להריץ אותו על מחשב נייח רגיל עם כרטיס מסך ביתי?

בצורה רשמית לא, כי נדרשים לפחות 42GB זיכרון גרפי ב־diffusers או 60GB במימוש הרשמי. עם זאת, גרסת ה־bf16 עם ייעול ב־ComfyUI יכולה לרוץ על כרטיסים של 24GB כמו RTX 3090 או 4090, אם כי הביצועים יהיו איטיים משמעותית.

איך מריצים

כדי להריץ אותו כמו שצריך תצטרכו חומרה רצינית מאוד. המאגר הרשמי דורש כרטיס H100 בודד או מערך של מספר כרטיסים, כשבכרטיס יחיד הצריכה מגיעה לכ־60GB של זיכרון גרפי. אם עובדים דרך ספריית diffusers עם פריקה למעבד וריצוף VAE, אפשר לרדת לדרישה של 42GB עבור הדיוק המלא.

למי שמחזיק כרטיסים קטנים יותר קיימת גרסת bfloat16 שמסתפקת ב־22GB של VRAM, אבל היא מגיעה עם ירידה מסוימת באיכות התוצאה. פתרונות צד שלישי כמו ComfyUI מאפשרים לדחוף אותו גם אל מתחת ל־20GB. אם אין לכם גישה לשרתי ענן עם מעבדים גרפיים מקצועיים, עדיף להשתמש ב־Playground של החברה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("genmo/mochi-1-preview")
img = pipe("a photo").images[0]

הקבצים

34 קבצים במאגר, 124 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 מלא. אפשר להשתמש במשקלים לצרכים מסחריים, לשנות את הקוד ולשלב אותו במוצרים פרטיים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗