GPT
W

Wan2.1-Fun-1.3B-InP

קוד פתוח

alibaba-paiapache-2.02025-03-17

  • videox_fun
  • diffusers
  • safetensors
  • i2v
  • video

משקל קל יחסית של וידאו מטקסט ותמונה, שמתמקד ביכולת לחבר בין תמונת פתיחה לתמונת סיום מוגדרת. הוא מתאים למי שרוצה שליטה במסגרת הזמן בלי לשרוף משאבי ענק על מודל של 14B.

  • 18.5 GBמשקל הקבצים
  • 2,331הורדות בחודש
  • 43לייקים

מה זה

מדובר במודל ליצירת וידאו מטקסט או מתמונה, בגודל 1.3 מיליארד פרמטרים, שפותח על בסיס ארכיטקטורת Wan2.1 ועבר התאמה בחבילת VideoX-Fun. התפקיד המרכזי שלו מתמקד ביכולת InP, שמשמעותה חיזוי והשלמת התנועה בין תמונת התחלה לתמונת סיום. מעבר לזה, הוא אומן לתמוך במספר רזולוציות שונות וכולל תמיכה בהנחיות באנגלית ובסינית.

היתרון המעשי כאן הוא שילוב של גודל קומפקטי יחסית עם פונקציונליות ממוקדת. מודלים גדולים מאותה משפחה, כמו גרסת ה־14B, דורשים נפחי אחסון וזיכרון עצומים. הגרסה הזו מציעה פתרון קל בהרבה לחומרה צנועה, כשהיא שומרת על יכולת החיבור בין שתי נקודות קצה חזותיות, בלי להסתפק רק בהנפשה עיוורת של פריים בודד.

מתאים ל

  • מעבר מבוקר בין פריימים

    יצירת סרטון שמגשר בצורה חלקה ומדויקת בין תמונת התחלה נתונה לתמונת סוף מוגדרת מראש.

  • אנימציה על מחשב מקומי

    הפקת קטעי וידאו קצרים על חומרת צרכנים עם 12GB זיכרון גרפי, בזכות משקל קל ואופטימיזציית זיכרון.

  • פיתוח בצנרת ComfyUI

    שילוב יצירת וידאו מהירה בתהליכי עבודה קיימים בלי צורך בחוות שרתים כבדה.

איפה זה נופל

הכרטיס מודה בפירוש ששימוש בקוונטיזציית qfloat8 מוריד מביצועי המודל ומאיכות הפלט. בנוסף, מודל של 1.3 מיליארד פרמטרים מוגבל בדיוק התנועה ובעושר הוויזואלי לעומת גרסת ה־14B. התמיכה בשפות מתרכזת באנגלית וסינית, כך שפרומפטים בעברית לא יעבדו בלי תרגום מוקדם. הרצה בלי כרטיס מסך מתאים מחייבת פריקה רציפה לזיכרון המחשב, מה שמאט את קצב יצירת הפריימים בצורה מורגשת מאוד.

שאלות
נפוצות

האם המודל מבין הנחיות טקסט בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. אם תזינו עברית, תקבלו תוצאות שגויות או התעלמות מההנחיה, לכן צריך לתרגם את הפרומפט לאנגלית לפני השליחה למודל.

מה עדיף, להריץ את גרסת ה־1.3B הזו או את גרסת ה־14B?

זה תלוי בחומרה שעומדת לרשותכם. גרסת ה־1.3B שוקלת 18.5GB ומסוגלת לרוץ על כרטיסי מסך ביתיים כמו 3060, בזמן שגרסת ה־14B שוקלת 47GB ודורשת משאבי עיבוד כבדים בהרבה כדי לא לקרוס מחוסר זיכרון.

איך מריצים

כדי לעבוד איתו צריך סביבת לינוקס או ווינדוס עם פייתון 3.10 או 3.11, גרסת PyTorch 2.2.0, וסביבת CUDA מתאימה. הכרטיס מציין תמיכה בכרטיסי צרכנים כמו RTX 3060 עם 12GB או RTX 3090, ועד לכרטיסי שרתים כמו V100 ו־A100. הקבצים שוקלים 18.5GB, אבל מומלץ להכין לפחות 60GB פנויים בדיסק להתקנה ולתלויות מסביב.

הקוד מספק תמיכה בהרצה דרך קובצי פייתון, ComfyUI או ממשק Gradio. כדי להסתדר עם מגבלות זיכרון גרפי, הספרייה מציעה מצבי פריקה למעבד וקוונטיזציה של Float8. אם אין לכם כרטיס עם 12GB ומעלה, ההרצה המקומית תהיה איטית מאוד, ובמצב כזה עדיף להשתמש בסביבות ענן כמו עליבאבא DSW שכוללות מכונות מוכנות.

pip install -U huggingface_hub
hf download alibaba-pai/Wan2.1-Fun-1.3B-InP

הרישיון

הפרויקט מופץ ברישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד, הפצה מחדש ושילוב במוצרים פרטיים או פתוחים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים וצירוף עותק של הרישיון בכל הפצה של הקוד או המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗