GPT
W

bullerwins/Wan2.2-T2V-A14B-GGUF

קוד פתוח

bullerwinsapache-2.02025-07-28

  • gguf
  • text-to-video

גרסת קוונטיזציה של מודל וידאו מתקדם, שמפצלת את תהליך הרינדור לשני מומחים נפרדים. היא מיועדת למי שרוצה להפיק וידאו מקומי דרך ComfyUI בלי להחזיק שרת מפלצתי.

  • 174 GBמשקל הקבצים
  • 10,870הורדות בחודש
  • 74לייקים

מה זה

המודל מייצר סרטוני וידאו קצרים באורך 5 שניות מטקסט בלבד, ברזולוציות של 480P ו־720P. המבנה הפנימי שלו מבוסס על חלוקה לשני מומחים שונים של 14 מיליארד פרמטרים, אחד מטפל בצעדי הרעש הראשוניים וקובע את המבנה הכללי, והשני נכנס לפעולה לקראת הסוף ובונה את הפרטים הקטנים. סך הפרמטרים עומד על 27 מיליארד, אבל בזכות הארכיטקטורה הזו פועלים רק 14 מיליארד בכל שלב.

לפי נתוני האימון של הפרויקט, המודל אומן על מאגר מוגדל ב־83.2% יותר סרטונים ו־65.6% יותר תמונות לעומת הגרסה הקודמת. התוצאה היא הבנה טובה יותר של תנועות מורכבות ושליטה מפורטת בתאורה ובסגנון קולנועי.

מתאים ל

  • רינדור וידאו ב־ComfyUI

    מאפשר לייצר סרטוני 720P מקומית בסביבת העבודה המוכרת דרך תוסף GGUF ייעודי.

  • אפקטים קולנועיים קצרים

    מתאים לסצנות הדורשות תאורה מדויקת וקומפוזיציה מוקפדת של עד חמש שניות.

  • תנועות גוף ודמויות

    נשען על דאטהסט מורחב ומודל מומחים שמבינים תנועה ופיזיקה טוב יותר מגרסאות עבר.

איפה זה נופל

הפלט מוגבל לסרטונים של חמש שניות בלבד, כך שאי אפשר לבנות איתו סצנות ארוכות באופן ישיר. הבעיה המרכזית ביומיום היא סרבול ההרצה. אתם חייבים לנהל שני מודלים במקביל עבור כל רינדור, וזמני היצירה יהיו איטיים מאוד על חומרה מקומית רגילה. בנוסף, כדי להגיע לתוצאות טובות באמת המפתחים ממליצים להשתמש במודל שפה נוסף כמו Qwen להרחבת הפרומפטים, מה שמוסיף עוד עומס כבד על זיכרון המערכת.

שאלות
נפוצות

למה צריך להוריד שני קבצים נפרדים?

המודל פועל בשיטת תערובת מומחים לפי רמת הרעש. קובץ אחד מוקדש לתחילת התהליך ולבניית הקומפוזיציה, והשני נכנס לפעולה בסוף כדי לחדד פרטים.

האם המודל תומך בהזנת תמונה כבסיס לווידאו?

לא. הקבצים האלו שייכים אך ורק לגרסת הטקסט לווידאו. לטובת יצירה מתמונה יש להשתמש בגרסת ה־I2V של הפרויקט.

איך מריצים

בשביל להריץ אותו מקומית צריך להתקין את ComfyUI-GGUF ולזרוק את הקבצים לתיקיית unet. החובה כאן היא להוריד שני קבצים נפרדים, אחד עבור שלב הרעש הגבוה והשני עבור הרעש הנמוך, ומשם לטעון את תרשים העבודה לדוגמה שמצורף לקבצים.

גרסאות ה־GGUF האלו חוסכות משמעותית בזיכרון, אבל עדיין מדובר במודל ענק. כרטיס המקור מציין שהרצה נקייה של המודל המלא דורשת כרטיס בודד של לפחות 80GB זיכרון וידאו, או פריסה מבוזרת על פני שמונה מעבדים גרפיים עם FSDP. אם אין לכם חומרה כבדה או לפחות כרטיס צרכני חזק עם תמיכה מלאה ב־offload, עדיף לפנות ל־API חיצוני.

ollama run hf.co/bullerwins/Wan2.2-T2V-A14B-GGUF:wan2.2_t2v_high_noise_14B_Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית של תוצרים ומערכות מבוססות עליו. הדרישה היא שמירה על זכויות היוצרים ומסמך הרישיון המקורי, והיוצרים מציינים מפורשות שהם אינם טוענים לזכויות על הסרטונים שנוצרים דרכו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗