GPT
D

daVinci-MagiHuman

קוד פתוח

GAIRapache-2.02026-03-21

  • safetensors
  • text-to-video
  • image-text-to-video
  • text-to-audio
  • text-to-audio-video

הופך תמונה יחידה וטקסט לווידאו מדבר בארכיטקטורה אחודה של 15 מיליארד פרמטרים. תוכנן במיוחד לסנכרון שפתיים, הבעות פנים ותנועת גוף יחד עם יצירת קול במקביל.

  • 201 GBמשקל הקבצים
  • 80הורדות בחודש
  • 335לייקים

מה זה

המודל מטפל בטקסט, תמונה, וידאו ואודיו ברצף טוקנים אחד דרך טרנספורמר של 40 שכבות. אין פה מנגנוני cross-attention מורכבים בין מודלים שונים, אלא עיבוד פנימי משותף שמנקה רעש מווידאו ומאודיו ביחד. המטרה כאן היא לייצר דמות אנושית שזזה ומדברת בלי הנתק המוכר שבו מייצרים קול בנפרד ומנסים להדביק אותו לווידאו.

במבחני איכות אנושיים מול 2,000 השוואות, הוא מנצח את Ovi 1.1 ב־80% מהמקרים ואת LTX 2.3 ב־60.9%. במדדי טקסט ודיוק שפתיים הוא מציג שיעור שגיאות מילים של 14.60%, ירידה חדה מול המתחרים, מה שאומר שהדיבור הנשמע תואם הרבה יותר טוב לתנועות הפה של הדמות שנוצרת על המסך.

מתאים ל

  • הנפשת דמויות לסרטונים

    יצירת אווטאר מדבר מתמונת פנים בודדת עם סנכרון תנועות פה וקול שנוצרים במקביל.

  • לוקליזציה רב-לשונית

    הפקת וידאו דובר בשפות נתמכות כמו אנגלית, צרפתית או מנדרינית מאותה תמונת מקור.

  • יצירת פרוטוטייפ וידאו מהיר

    בדיקת רעיונות בגרסת ה־Distilled שמייצרת וידאו ב־8 צעדים תוך 2 שניות ברזולוציה נמוכה.

איפה זה נופל

העבודה כולה נשענת על מודל בסיס ברזולוציה נמוכה מאוד של 256p, וכל איכות גבוהה יותר תלויה לחלוטין במודל Super-Resolution נפרד שמוסיף עשרות שניות לכל ריצה. בנוסף, אף שהמודל תומך במספר שפות, עברית לא נכללת בהן כלל. תמיכת השפות מוגבלת לאנגלית, מנדרינית, קנטונזית, יפנית, קוריאנית, גרמנית וצרפתית, כך שהתאמת שפתיים לדיבור בעברית לא תעבוד באופן אמין בלי אימון נוסף.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיס מסך ביתי?

לא. משקל הקבצים לבדו חוצה את 200 הג'יגה בייט ומדובר במודל של 15 מיליארד פרמטרים שדורש ארכיטקטורת H100 עם גרסאות Flash Attention ייעודיות. כרטיסים צרכניים פשוט יקרסו מחוסר זיכרון.

האם המודל יודע לדבר בעברית?

הכרטיס מפרט תמיכה בשבע שפות ספציפיות ועברית אינה אחת מהן. יצירת וידאו עם סאונד וסנכרון שפתיים בעברית לא נתמכת מהקופסה ותדרוש התאמות ואימון עצמאי.

מה נותנת שיטת ה־Single Stream לעומת מודלים אחרים?

במקום לייצר אודיו במודל אחד ואז להריץ מודל נוסף שמתאים את הפה של הווידאו לקול, המודל מחשב את הווידאו והאודיו יחד באותו רצף תשומת לב. זה מקטין עיכובים ומייצר תיאום טבעי יותר בין הבעת הפנים לצליל.

איך מריצים

קובצי המודל שוקלים 201 ג'יגה בייט ודורשים חומרת שרתים רצינית. כדי להריץ את הצינור המלא שכולל קומפילציה ב־MagiCompiler ו־Flash Attention, צריך כרטיס ברמת Nvidia H100. על החומרה הזו וידאו בסיסי של 5 שניות ב־256p נוצר תוך 2 שניות, אבל מעבר לרזולוציית 1080p באמצעות שלב ה־Super-Resolution כבר לוקח 38.4 שניות.

אם אין לכם קלאסטר שרתים ייעודי עם נפח VRAM מאסיבי וכרטיסי Hopper, אין טעם לנסות להרים את זה מקומית. התקנת הסביבה דורשת Python 3.12, PyTorch 2.9 וספריות קומפילציה ייעודיות, כך שלרוב הצוותים יהיה זול ופשוט יותר להשתמש ב־API או ב־Spaces אם המטרה היא בדיקת היתכנות מהירה.

pip install -U huggingface_hub
hf download GAIR/daVinci-MagiHuman

הקבצים

56 קבצים במאגר, 201 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מלא וחופשי. אפשר להשתמש במודל, בקוד ובמשקלים במוצרים מסחריים, לשנות אותם ולהפיץ אותם מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן הגבלות שימוש נסתרות או דרישות לתמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗