GPT
W

Wan2.1-T2V-1.3B

קוד פתוח

Wan-AIapache-2.02025-02-25

  • diffusers
  • safetensors
  • t2v
  • video
  • video-generation

המודל מייצר סרטוני וידאו קצרים מטקסט ומסתפק בזיכרון גרפי צנוע יחסית. מורידים אותו כשרוצים לבדוק יכולות יצירת וידאו על כרטיס מסך ביתי בלי לשלם על שרתי ענן יקרים.

  • 1.4Bפרמטרים
  • 16.4 GBמשקל הקבצים
  • 23,514הורדות בחודש
  • 531לייקים

מה זה

מדובר במודל Diffusion Transformer קומפקטי שמיועד להפקת וידאו מתיאור טקסטואלי, בעיקר ברזולוציה של 480P. הוא כולל ארכיטקטורת 3D VAE שדוחסת נתונים בזמן ובמרחב, יחד עם מקודד T5 להבנת טקסט בכמה שפות. תכונה בולטת כאן היא היכולת לשלב טקסט גרפי קריא בתוך הסרטון עצמו באנגלית ובסינית, אלמנט שבדרך כלל נכשל לחלוטין במודלים פתוחים.

המפרסמים בדקו אותו מול מודלים פתוחים וסגורים על בנצ'מרק של 1,035 פרומפטים. המדידה מראה שהגרסה הקטנה הזו עוקפת מודלים פתוחים גדולים יותר באיכות התנועה וההתאמה לפקודה. המשמעות בפועל היא יחס ביצועים טוב מאוד לנפח המודל, מה שמאפשר להגיע לווידאו שמיש ברזולוציית בסיס בלי להחזיק אשכול שרתים.

מתאים ל

  • בדיקות היתכנות מקומיות

    מאפשר לבדוק פייפליין של יצירת וידאו ישירות על תחנת עבודה עם כרטיס ביתי, בלי עלויות ענן.

  • הטמעת טקסט בווידאו

    מתאים לסרטונים שדורשים שלטים או כתוביות באנגלית ובסינית, תחום שבו הוא מתפקד טוב ממתחרים.

  • מחקר אקדמי דל משאבים

    נותן בסיס פתוח וקל משקל לניסויי וידאו וארכיטקטורת DiT מבלי להזדקק לתשתית שרתים כבדה.

איפה זה נופל

הרזולוציה המומלצת מוגבלת ל־480P. המודל אמנם מסוגל טכנית להפיק 720P, אך היוצרים מודים שהאימון ברזולוציה הזו היה מוגבל והתוצאות אינן יציבות. בנוסף, כדי להגיע לאיכות טובה נדרש שלב הרחבת פרומפט באמצעות מודל שפה נפרד כמו Qwen או קריאת API של Dashscope, מה שמוסיף מורכבות למערכת. המודל אינו תומך בעברית, כך שתצטרכו לתרגם כל פקודה לאנגלית או סינית לפני השליחה.

אותה משפחה

Wan2.1-T2V יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לייצר סרטונים בעברית?

לא ישירות. המודל אומן על אנגלית וסינית בלבד, ולכן פרומפטים בעברית יפיקו תוצאות שגויות או ריקות. אם אתם בונים מוצר למשתמשים ישראלים, תצטרכו להוסיף שכבת תרגום אוטומטית שתמיר את הטקסט לאנגלית לפני שהוא מגיע למודל.

האם הוא מתאים ליצירת וידאו על בסיס תמונה קיימת?

הגרסה הספציפית הזו יודעת לקבל טקסט בלבד ולהפוך אותו לווידאו. אם אתם צריכים Image-to-Video, תצטרכו לפנות לגרסת ה־14B של המיזם, שכן גרסת ה־1.3B לא כוללת כרגע משקולות מתאימות למשימה זו.

איך מריצים

ההרצה המקומית דורשת כ־8.19 גיגה זיכרון גרפי, כך שכרטיס RTX 4090 מריץ אותו בקלות. על כרטיס כזה, יצירת קליפ של חמש שניות ב־480P לוקחת כארבע דקות ללא קוונטיזציה. אם נתקלים בחוסר זיכרון, מפעילים פריקה לזיכרון המערכת עם offload_model ומשאירים את מקודד ה־T5 על המעבד.

מי שצריך תפוקה מהירה או רזולוציית 720P יציבה יעדיף לפנות לגרסת ה־14B הגדולה יותר, או להשתמש ב־API חיצוני. בריצה מקומית על כרטיס בודד, זמן ההמתנה ממושך מדי עבור שירות שצריך לענות בזמן אמת למשתמשי קצה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-T2V-1.3B")
img = pipe("a photo").images[0]

הרישיון

הקוד והמשקולות שוחררו ברישיון Apache 2.0 המלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. היוצרים אינם דורשים בעלות על התוכן המופק, אך מטילים אחריות חוקית מלאה על המשתמש למניעת יצירת תוכן מזיק או לא חוקי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗