GPT
L

LightWan2.2-A14B

קוד פתוח

lightx2vapache-2.02026-05-28

  • diffusers
  • video_generation
  • NVFP4
  • Sparse_Attention
  • Wan

גרסה מזוקקת ומכווצת של מודל הווידאו Wan 2.2 שמייצרת סרטונים בארבעה צעדים בלבד. מתאים למי שמחזיק כרטיס מדור בלקוול ורוצה רינדור מהיר במיוחד.

  • 62.4 GBמשקל הקבצים
  • 5,065הורדות בחודש
  • 50לייקים

מה זה

מדובר במודל MoE בגודל 14 מיליארד פרמטרים ליצירת וידאו מטקסט או מתמונה, שעבר כיול קוונטיזציה של NVFP4 וזיקוק צעדים. במקום עשרות צעדי דגימה כמו במודל המקורי, הוא רץ על ארבעה בלבד, שני צעדים עם מומחי רעש גבוה ושניים עם מומחי רעש נמוך. בנוסף, מופעל מנגנון קשב דליל שמאיץ את החישובים הכבדים ברזולוציות גבוהות.

התוצאות בכרטיס המודל מציגות ירידה דרמטית בזמני ההמתנה בהרצה על כרטיס RTX 5090 יחיד. יצירת וידאו מטקסט ב־720p צונחת מכמעט 45 דקות במודל הבסיס ל־22.5 שניות, וברזולוציית 480p הזמן יורד מ־734 שניות ל־9.1 שניות. ההאצה הזו נשענת על חומרת בלקוול בלבד, כך שלא מדובר בשיפור תוכנתי שמשפיע באותה צורה על כרטיסים ישנים.

מתאים ל

  • רינדור וידאו מהיר ב־720p

    מאפשר הפקת סרטון מלא תוך פחות מחצי דקה על כרטיס RTX 5090 יחיד.

  • הנפשת תמונות בזמן קצר

    מייצר וידאו מקובץ תמונה ב־480p תוך 10.7 שניות בלבד, מתאים לפיתוח אינטראקטיבי.

  • עיבוד מקבילי בכמה כרטיסים

    כולל תסריטי הרצה מובנים לחלוקת עומסי Sequence Parallel על מספר מעבדים גרפיים.

איפה זה נופל

המגבלה המרכזית היא התלות המוחלטת בחומרת Blackwell ובקרנלים של NVFP4. אי אפשר לקחת אותו לשרתים ותיקים יותר עם כרטיסי A100 או RTX 4090 ולקבל את אותם זמנים. בנוסף, ארבעה צעדי דגימה דורשים פשרה מובנית מול המודל המלא, ויש סיכון לפספוס פרטים מורכבים או ארטיפקטים בתנועה מהירה. מעבר לכך, הדרישה לרכיבי עזר נפרדים כמו VAE ו־T5 אומרת שתהליך ההקמה הראשוני מסורבל ולא עובד בהורדה של קובץ בודד.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסדרת RTX 40 או A100?

לא מומלץ. דרישות המערכת מציינות במפורש כרטיסי RTX 50 או חומרת Blackwell אחרת. הקרנלים של NVFP4 והאופטימיזציות מיועדים לארכיטקטורה הזו, ובחומרה ישנה יותר לא תקבלו את המהירות הזו אם הקוד בכלל יתקמפל.

האם הקבצים במאגר כוללים את כל מה שצריך כדי לייצר וידאו?

לא. המאגר מכיל את משקולות המודל בלבד, בגודל 62.4 גיגה בייט. בשביל להריץ אותו צריך להוריד בנפרד את רכיבי T5 ו־VAE של Wan 2.2, ועבור יצירה מתמונה לווידאו נדרש גם מקודד תמונה ייעודי.

איך מריצים

כדי להריץ אותו בפועל חייבים כרטיס מסדרת RTX 50 או מעבד גרפי אחר שמבוסס על ארכיטקטורת Blackwell של אנבידיה. מעבר למודל עצמו, ששוקל 62.4 גיגה בייט, צריך להכין רכיבי T5 ו־VAE של Wan 2.2, ובמקרה של תמונה לווידאו גם מקודד תמונה תואם. הדרך הפשוטה היא להשתמש בתמונת הדוקר הרשמית lightx2v שמגיעה עם דרייברים מתאימים ל־CUDA 13.

אם אין לכם כרטיס בלקוול ייעודי, אין טעם לנסות להריץ את זה מקומית. הידור הקרנלים של NVFP4 תלוי בארכיטקטורה הזו וספריות Cutlass, כך שבלי החומרה הזו הביצועים יתרסקו או שהקוד לא ירוץ. במצב כזה עדיף לשלם ל־API חיצוני שמחזיק את השרתים האלה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/LightWan2.2-A14B")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗