GPT
W

Wan2.2-TI2V-5B-Diffusers

קוד פתוח

Wan-AIapache-2.02025-07-28

  • diffusers
  • safetensors
  • text-to-video
  • en
  • zh

המודל מייצר וידאו מטקסט או מתמונה ברזולוציית 720P ובקצב 24fps. הוא מכוון למי שרוצה להריץ מודל וידאו מקומי על כרטיס מסך צרכני בלי צורך בחוות שרתים.

  • 5Bפרמטרים
  • 31.9 GBמשקל הקבצים
  • 187,953הורדות בחודש
  • 162לייקים

מה זה

מדובר במודל צפוף עם 5 מיליארד פרמטרים שמשלב יצירת וידאו מטקסט ומתמונה באותו מבנה. הוא לא משתמש בארכיטקטורת ה־MoE שנמצאת בדגמים הגדולים יותר של הסדרה, אלא נשען על VAE עם יחס דחיסה גבוה במיוחד של 16x16x4 במרחב ובזמן, יחד עם שכבת חלוקה שמביאה את הדחיסה הכוללת ל־4x32x32. הדחיסה הזו מקטינה משמעותית את כמות המידע שהרשת צריכה לעבד בכל צעד.

האימון נעשה על נפח תוכן גדול משמעותית מהגרסה הקודמת, עם תוספת של 65.6% תמונות ו־83.2% סרטונים, וכולל תיוג של תאורה, קומפוזיציה וצבעים. המודל שומר על קצב של 24 פריימים לשנייה ברזולוציה שמגיעה ל־1280 על 704 פיקסלים. ההתאמה לספריית diffusers הופכת את השילוב שלו בפייפליינים קיימים לפשוט, במיוחד למי שכבר עובד בסביבה הזו.

מתאים ל

  • הנפשת תמונות מקומית

    הפיכת תמונות סטילס לקטעי וידאו קצרים ברקע, ישירות על חומרה ביתית מתאימה.

  • מחקר והתנסות ביצירת וידאו

    בדיקת ארכיטקטורות דחיסה ואימון מתקדם ללא תלות בתשתיות ענן יקרות.

  • יצירת סרטוני בדיקה

    הפקת דוגמאות וידאו מהנחיות טקסט באנגלית עבור פרויקטים שלא דורשים מענה מיידי.

איפה זה נופל

החיסרון הברור ביותר הוא הזמן, תשע דקות לסרטון של חמש שניות על כרטיס צרכני זה המון, וזה מגביל את השימוש בעיקר לעיבודים ברקע ולא ליישומים אינטראקטיביים. הרזולוציה המקסימלית מוגבלת ל־720P, והשפות הנתמכות הן אנגלית וסינית בלבד, כך שטקסט בעברית בהנחיות לא יעבוד בצורה אמינה. בנוסף, ההרצה באמצעות ספריית diffusers מחייבת התקנה ישירות ממאגר הקוד של הפרויקט ולא מהגרסה היציבה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך עם פחות מ־24GB זיכרון?

הכרטיס הרשמי מציין דרישה לכרטיס עם לפחות 24GB זיכרון גרפי, כמו RTX 4090, וגם זה רק כאשר מפעילים פריקת רכיבים למעבד ולזיכרון הראשי. כרטיסים קטנים יותר לא יוכלו להחזיק את התהליך בלי שגיאות זיכרון.

האם הדגם הזה כולל את טכנולוגיית ה־MoE של הסדרה?

לא. ארכיטקטורת המומחים קיימת רק בדגמי ה־14B הגדולים יותר של Wan2.2. דגם ה־5B הוא מודל צפוף סטנדרטי שנבנה סביב רכיב VAE עם דחיסה גבוהה במיוחד כדי לאפשר פעולה על חומרה נגישה.

איך מריצים

כדי להריץ אותו על כרטיס יחיד כמו RTX 4090 עם 24GB זיכרון, חובה להפעיל דגלים של פריקת רכיבים, המרת טיפוסי נתונים, והרצת מקודד ה־T5 על המעבד המרכזי. לפי הנתונים, יצירת סרטון של חמש שניות בכרטיס כזה לוקחת כמעט תשע דקות. אם יש לכם מאיץ עם 80GB זיכרון, אפשר לוותר על הפריקה לזיכרון המערכת ולקצר את זמני ההמתנה.

אם אתם צריכים זמן תגובה מהיר למשתמשי קצה, הרצה מקומית על כרטיס בודד תהיה איטית מדי. תזדקקו לכמה כרטיסים שעובדים במקביל עם חלוקת משימות, או שתעדיפו להשתמש בשרת ייעודי חזק במקום לנהל את החומרה לבד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.2-TI2V-5B-Diffusers")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית בתוך מוצרים. אין דרישה לפתוח את הקוד שלכם או לחלוק רווחים, ואין זכויות על התוכן המופק, כל עוד שומרים על תנאי השימוש החוקיים ולא מייצרים תוכן פוגעני או מזיק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗