GPT
W

Wan2.1-T2V-1.3B-Diffusers

קוד פתוח

Wan-AIapache-2.02025-03-01

  • diffusers
  • safetensors
  • video
  • video-generation
  • text-to-video

מודל טקסט לווידאו קומפקטי של Wan-AI שמסוגל לרוץ על כרטיס מסך ביתי יחיד. הוא מתאים למי שרוצה לייצר וידאו מקומית בלי לשלם על חוות שרתים כבדה.

  • 1.4Bפרמטרים
  • 26.9 GBמשקל הקבצים
  • 274,662הורדות בחודש
  • 154לייקים

מה זה

המודל מייצר סרטוני וידאו קצרים מטקסט ומשתמש בארכיטקטורת Diffusion Transformer מבוססת Flow Matching יחד עם מקודד T5 ורכיב Wan-VAE לעיבוד המרחב והזמן. היתרון הבולט שלו הוא היכולת לרנדר טקסט קריא באנגלית ובסינית ישירות בתוך הווידאו, יכולת שחסרה ברוב המודלים הפתוחים. קבצי המשקלים תופסים 26.9 גיגה בייט ומותאמים לעבודה ישירה עם ספריית diffusers, מה שמקל על ההטמעה בקוד פייתון קיים.

במבחני Wan-Bench הפנימיים שכללו 1,035 פרומפטים ב־14 ממדים שונים, היוצרים מדווחים כי הגרסה הקטנה הזו עוקפת מודלים פתוחים גדולים בהרבה. בפועל, המשמעות של תוצאות המדידה האלה היא שהמודל מצליח לספק תנועה עקבית ואיכות ויזואלית סבירה גם בלי נפח הפרמטרים העצום של גרסת ה־14B, אך עדיין מדובר במבחן השוואתי שנבחר ונמדד בידי המפתחים עצמם.

מתאים ל

  • מחקר ובדיקות מקומיות

    מאפשר לאנשי פיתוח לבחון מודל וידאו מלא על חומרה ביתית ללא עלות שרתים.

  • יצירת סרטונים עם כיתוב

    מתאים לסרטונים שדורשים שילוב טקסט ויזואלי קריא באנגלית או בסינית.

  • עיבוד וידאו באצווה

    אידיאלי לתהליכי רקע שאינם דורשים תוצאה מיידית ויכולים להמתין מספר דקות.

איפה זה נופל

המגבלה המרכזית היא איכות הרזולוציה. הכרטיס מציין בפירוש שהמודל אומן בעיקר עבור 480P, ולמרות שהוא מסוגל טכנית להפיק 720P התוצאות ברזולוציה הגבוהה אינן יציבות ואינן מומלצות לשימוש. בנוסף, המודל תומך כרגע בטקסט באנגלית ובסינית בלבד, כך שאין תמיכה מובנית בפרומפטים או בכיתוב בעברית. חיסרון נוסף שחייבים לקחת בחשבון הוא זמן הריצה האיטי, כארבע דקות לסרטון בודד של חמש שניות על חומרה חזקה, מה שמונע שילוב שלו במוצר שדורש תגובה מיידית בלי תהליך עיבוד מקדים.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך פשוט?

כן, המודל דורש 8.19 גיגה בייט זיכרון מסך בעת הפעלה עם פריקה לזיכרון המרכזי. כרטיסים ביתיים מודרניים מסוגלים להריץ אותו, אך יצירת סרטון של חמש שניות תיקח כארבע דקות.

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד, הן עבור הבנת הפרומפטים והן עבור הטקסט הוויזואלי שנוצר בתוך הווידאו. שימוש בעברית ידרוש תרגום מוקדם לאנגלית.

למה כדאי לבחור בו ולא בגרסת ה־14B?

גרסת ה־1.3B מיועדת למי שאין לו אשכול שרתי ענן או כרטיסי מסך מרובים עם נפח זיכרון עצום. היא מאפשרת לבצע ניסויים ולהפיק תוצרי 480P ישירות על מחשב אישי.

איך מריצים

כדי להריץ אותו מקומית תצטרכו מעבד גרפי עם 8.19 גיגה בייט של זיכרון מסך לפחות, שזה טווח שמתאים לרוב כרטיסי המסך הביתיים המודרניים. על כרטיס RTX 4090 יצירת סרטון של חמש שניות ברזולוציית 480P לוקחת כארבע דקות ללא קוונטיזציה, תוך שימוש בדגלי פריקה לזיכרון המחשב כמו offload_model וטעינת ה־T5 למעבד המרכזי כדי למנוע קריסות זיכרון.

אם אתם צריכים תוצאות מהירות בזמן אמת, איכות גבוהה ב־720P או עבודה מול משתמשי קצה רבים, עדיף להשתמש בגרסת ה־14B הגדולה יותר או לגשת לתשתית חיצונית דרך API, במקום לחכות דקות ארוכות לכל סרטון בודד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-T2V-1.3B-Diffusers")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0 המאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או מסחרית במוצר שלכם. היוצרים מצהירים שאין להם זכויות על התוכן המופק, אך אתם נושאים באחריות המלאה שלא להפר חוק או להפיץ מידע מטעה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗