GPT
W

Wan2.2-T2V-A14B-Diffusers

קוד פתוח

Wan-AIapache-2.02025-07-28

  • diffusers
  • safetensors
  • text-to-video

מודל פתוח ליצירת וידאו מטקסט באיכות קולנועית. הוא משתמש בארכיטקטורת מומחים כדי לתת איכות תמונה ותנועה גבוהות בלי לנפח את זמן החישוב בכל צעד.

  • 14Bפרמטרים
  • 118 GBמשקל הקבצים
  • 165,638הורדות בחודש
  • 157לייקים

מה זה

המודל מייצר סרטונים של 5 שניות ברזולוציות של 480P או 720P מתוך הנחיית טקסט. המבנה שלו מבוסס על שני מומחים של כ־14 מיליארד פרמטרים כל אחד, כך שסך הפרמטרים מגיע ל־27 מיליארד, אבל בכל צעד הסרת רעש פעיל רק מודל אחד. מומחה הרעש הגבוה בונה את הקומפוזיציה והמבנה הראשוני, ומומחה הרעש הנמוך נכנס לפעולה לפי סף יחס אות לרעש כדי לדייק את הפרטים הקטנים. שיטת העבודה הזו שומרת על עלות חישוב של מודל 14B רגיל תוך הגדלת הקיבולת.

אימון המודל כלל תוספת של 65.6% תמונות ו־83.2% סרטונים ביחס לגרסה 2.1, עם דגש על תיוג מפורט של תאורה, צבעים וקומפוזיציה. במבחן Wan-Bench 2.0 המפתחים מציגים עליונות על מודלים מסחריים סגורים בממדי תנועה ואסתטיקה. בפועל זה אומר פחות עיוותים בתנועות מורכבות ושליטה טובה יותר בסגנון הוויזואלי דרך הפרומפט.

מתאים ל

  • הפקת שוטי וידאו קצרים

    מתאים לקליפים של עד 5 שניות ברזולוציה של 720P עבור תוכן פרסומי או סושיאל שדורש דיוק בצבע ובתאורה.

  • סביבת מחקר ל־MoE בדיפוזיה

    בסיס מעולה לחוקרים שרוצים לבחון ניתוב מומחים בזמן הסרת רעש במודלי וידאו פתוחים לחלוטין.

  • הדמיית תנועה מורכבת

    טוב ליצירת סצנות פעולה קצרות שבהן מודלים קטנים יותר נוטים לעוות גופים ואובייקטים בתנועה.

איפה זה נופל

משקל הקבצים עומד על 118GB, מה שהופך את ההורדה והטעינה לסיוט תשתיתי. אורך הווידאו מוגבל ל־5 שניות בלבד, כך שהוא לא מתאים ליצירת רצפים ארוכים בלי עריכה חיצונית. בנוסף, כדי לקבל תוצאות טובות באמת המפתחים ממליצים להרחיב את הפרומפט באמצעות מודל שפה מקומי של Qwen או קריאת API חיצונית, מה שמוסיף עוד שלב ומשאבים לכל בקשה. התמיכה בספריית Diffusers דורשת התקנה ישירות מקוד המקור של גיטהאב ולא מהגרסה היציבה.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא. המודל דורש לפחות 80GB זיכרון גרפי להרצה על כרטיס יחיד עם פריקת זיכרון. אם יש לכם כרטיס של 24GB, תצטרכו להשתמש בגרסת ה־5B של המשפחה הזו.

האם חייבים מודל שפה נוסף בשביל לייצר וידאו?

לא חייבים, אפשר להריץ בלי הרחבת פרומפטים ישירות מהטקסט שלכם. עם זאת, המפתחים ממליצים להשתמש במודל שפה מקומי כמו Qwen או שירות חיצוני כדי להעשיר את התיאור ולקבל תוצאה מפורטת בהרבה.

איך מריצים

כדי להריץ את המודל על כרטיס בודד צריך לפחות 80GB זיכרון גרפי, וגם אז חובה להפעיל דחיפת מודל לזיכרון המחשב וחישוב T5 על המעבד. בסביבת ייצור ההמלצה היא שרת של 8 כרטיסי מסך עם שילוב של FSDP ו־DeepSpeed Ulysses כדי לחלק את העומס ולקבל זמני תגובה שפויים.

אם אין לכם שרת ייעודי כזה בחצר, הרצה עצמית פשוט תעלה יותר מדי כסף ותהיה אטית. למי שרוצה חומרה ביתית זולה יותר, עדיף להסתכל על דגם ה־5B שלהם שרץ על כרטיסי 4090, או לפנות לפתרונות ענן שמציעים את השירות במחיר לפי קריאה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.2-T2V-A14B-Diffusers")
img = pipe("a photo").images[0]

הקבצים

49 קבצים במאגר, 118 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור גישה אליו, בלי לשלם תמלוגים. היוצרים מבהירים שאין להם זכויות על התוצרים שנוצרים, אך חלה אחריות מלאה על המשתמש שלא להפר חוק, לפגוע באחרים או להפיץ מידע מטעה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗