GPT
W

Wan14BT2VFusioniX

קוד פתוח

vrgamedevgirl84apache-2.02025-06-04

  • diffusers
  • text-to-video
  • diffusion
  • merged-model
  • video-generation

מיזוג קהילתי כבד של Wan 2.1 ליצירת וידאו מטקסט, שתוכנן לתת תנועה קולנועית ואיכות טובה כבר ב־8 צעדים במקום עשרות.

  • 114 GBמשקל הקבצים
  • 5,429הורדות בחודש
  • 618לייקים

מה זה

מדובר בהרחבה של Wan 2.1 14B 720p שאיחדה לתוכה כמה פיתוחי מחקר ורשתות LoRA, בהם CausVid לתנועה, AccVideo להאצה וסנכרון זמני, MoviiGen1.1 לתאורה ו־MPS Reward. המטרה כאן היא לחתוך את כמות הצעדים הנדרשת לרינדור סביר, כך שבמקום לחכות דקות ארוכות לכל דגימה אפשר לקבל פלט מלא בין 6 ל־10 צעדים.

התוצאה מתבטאת ישירות בזמני הריצה. לפי נתוני המפתח, כרטיס RTX 5090 מייצר סרטון של 81 פריימים ברזולוציה של 1024 על 576 בכ־138 שניות. כאשר משתמשים בגרסת ה־LoRA על מודל בסיס fp8, 8 צעדים יורדים מ־160 שניות במודל המלא ל־120 שניות. הטקסטורה והתנועה עשירות יותר מגרסת הבסיס ללא התוספים, אך המיזוג הופך את המערכת לרגישה מאוד להגדרות התוכנה.

מתאים ל

  • ניסויי וידאו ב־ComfyUI

    מאפשר לבדוק רעיונות תנועה וטקסטורה ב־8 צעדים מהירים יחסית לחומרה כבדה.

  • הפקת וידאו מטקסט למחקר

    משלב CausVid ו־AccVideo בתוך סביבה אחת לבחינת דינמיקה וזרימה של תנועה.

  • בדיקת שילובי LoRA

    הגרסה מאפשרת הלבשת LoRA ייעודי על מודל הבסיס ושליטה בעוצמת הסגנון.

איפה זה נופל

חובה לעבוד עם ערכי CFG מקובעים על 1, אחרת התוצאה נהרסת לחלוטין, וערכי ה־Shift דורשים כוונון ידני לפי הרזולוציה המדויקת. המפתח מזהיר במפורש לא להשתמש ב־teacache, וכל ניסיון להוסיף מחדש LoRAs שכבר מוזגו בפנים כמו CausVid או AccVideo יפגע באיכות. המודל גם לא נבדק עם מנגנונים כמו SLG, והוא דורש רכיבי עזר חיצוניים כדי להוציא פרומפטים מפורטים מספיק שלא ייראו שטוחים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשירות וידאו בתשלום?

לא. אף שבראש הדף מופיע רישיון Apache 2.0, בפנים מוזגו רכיבים עם רישיונות CC BY-NC-SA 4.0 המגבילים שימוש מסחרי.

איך אפשר לזרז את הרינדור בלי לפגוע באיכות?

עוברים לתוסף SageAttn שמקצר זמנים בכ־30 אחוזים בתוך ה־wrapper, ומגדירים בין 8 ל־10 צעדים עם מתזמן uni_pc ו־CFG על 1.

כמה זיכרון וידאו צריך כדי להריץ אותו?

הקבצים שוקלים 114 גיגה־בייט ומיועדים לכרטיסי על כמו RTX 5090. אם אין לכם חומרה כזו, תצטרכו להפעיל block swapping או לעבור לגרסאות GGUF.

איך מריצים

המשקל הכולל של הקבצים עומד על 114 גיגה־בייט ב־41 קבצים, כך שצריך כונן מהיר והרבה מאוד זיכרון. להרצה מקומית מומלץ להשתמש ב־ComfyUI דרך Kijai Wan Wrapper עם SageAttn שמקצר זמנים בכ־30 אחוזים. אם כרטיס המסך נחנק מחוסר VRAM, יש להפעיל block swapping ולהתחיל מחמישה בלוקים, או לעבור ישירות לגרסאות GGUF קוונטיות שהוכנו לפרויקט.

המפתח מספק גם LoRA עצמאי שאפשר להלביש על מודל הבסיס של Wan כדי לחסוך משאבים ולשלוט בעוצמת האפקט. מי שאין לו חומרת קצה כמו RTX 5090 או כרטיסים מקבילים עתירי זיכרון יתקשה מאוד לייצר כאן רצפים ארוכים בקצב הגיוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("vrgamedevgirl84/Wan14BT2VFusioniX")
img = pipe("a photo").images[0]

הקבצים

41 קבצים במאגר, 114 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

למרות שהמאגר מסומן תחת apache-2.0, הכרטיס מבהיר שהמיזוג כולל רכיבי מחקר כמו CausVid המוגבלים תחת רישיונות לא־מסחריים כדוגמת CC BY-NC-SA 4.0. המשמעות ברורה: אסור להשתמש במודל הזה במוצר מסחרי, והוא מיועד למחקר ולשימוש אישי בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗