GPT
W

Wan2.1-VACE-14B

קוד פתוח

Wan-AIapache-2.02025-05-13

  • diffusers
  • safetensors
  • vace
  • video generation
  • video-to-video editing

גרסה זו מציעה מודל כולל ליצירה ולעריכת וידאו מתמונה. מי שצריך שליטה מלאה בייצור וידאו בקוד פתוח יבחר בו, במיוחד אם דרוש שילוב טקסט חזותי באנגלית ובסינית.

  • 17Bפרמטרים
  • 70.0 GBמשקל הקבצים
  • 9,476הורדות בחודש
  • 505לייקים

מה זה

מדובר במודל עריכה ויצירה שמשלב כמה משימות וידאו תחת ארכיטקטורה אחת. הוא תומך ברזולוציות של 480P וגם 720P, ומביא יכולת מובנית ליצירת טקסט חזותי קריא בשפות אנגלית וסינית בתוך הווידאו עצמו. המערך נשען על רכיב VAE ייעודי שמסוגל לדחוס ולפרוס וידאו באיכות גבוהה תוך שמירה על עקביות הזמן בין הפריימים.

בניגוד למודלים ייעודיים שמבצעים רק המרה בסיסית של תמונה לסרטון, גרסת ה־VACE מיועדת לעבודות יצירה ועריכה רחבות יותר. מפתחי המודל טוענים לביצועים מובילים מול פתרונות קוד פתוח ומסחריים קיימים, אם כי כרטיס המודל לא חושף ציוני מדדים מספריים ספציפיים שמוכיחים זאת ישירות.

מתאים ל

  • עריכת וידאו משולבת

    מאפשר עריכה ויצירה של סרטונים קצרים על בסיס תמונת מקור ברזולוציה של עד 720P.

  • שלטים וטיפוגרפיה בווידאו

    מתאים לסרטונים שדורשים הופעת טקסט קריא באנגלית או בסינית ישירות בתוך הסצנה.

  • פייפליין עצמאי בארגון

    התקנה על שרתי הארגון למי שחייב לעבד נכסי מדיה בלי להוציא מידע לשירותי צד שלישי.

איפה זה נופל

האינטגרציה עם diffusers עבור גרסת ה־VACE ומערכי מרובי כרטיסים עדיין נמצאת ברשימת המשימות הפתוחות ולא הושלמה במלואה. מעבר לזה, המודל מתבסס בכבדות על הרחבת פרומפטים כדי להגיע לתוצאות טובות, מה שמחייב הרצת מודל שפה נוסף במקביל כמו Qwen או שימוש ב־API חיצוני של עליבאבא. תמיכת השפות מוגבלת לאנגלית ולסינית בלבד, כך שטקסט חזותי בעברית או פרומפטים מקומיים לא יתפקדו כראוי.

אותה משפחה

Wan2.1-VACE יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי עם כרטיס מסך רגיל?

לא מומלץ בכלל. הקבצים שוקלים 70 גיגה־בייט והמודל דורש זיכרון וידאו עצום שקיים רק בשרתים ייעודיים או במערכי מרובי כרטיסים. למחשב אישי עדיף לבחור בגרסת ה־1.3B.

למה צריך מודל נוסף כמו Qwen בזמן ההרצה?

היוצרים ממליצים להרחיב את הפרומפטים כדי לקבל תוצאות ויזואליות עשירות ויציבות. ההרחבה הזו דורשת מודל שפה מקומי נוסף או גישה ל־API של Dashscope, מה שמוסיף מורכבות למערכת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־70 גיגה־בייט, מה שאומר שהרצה מקומית דורשת כרטיסי מסך חזקים מאוד עם זיכרון וידאו גבוה. להרצה מהירה ובאיכות 720P מומלץ לעבוד עם מערך מרובה כרטיסים דרך FSDP ו־xDiT. אפשר להריץ אותו בכרטיס יחיד רק אם משתמשים בטכניקות כמו פריקת מודל והעברת הקידוד למעבד, מה שיאט את התהליך באופן מורגש.

גרסת ה־1.3B הקטנה יותר יכולה לרוץ על כרטיס ביתי כמו RTX 4090 בכארבע דקות לסרטון קצר, אבל הגרסה הזו מיועדת לשרתים. אם אין לכם חומרת שרתים ייעודית, עדיף להסתמך על שירותי ענן או API חיצוני במקום לנסות להחזיק אותה עצמאית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-VACE-14B")
img = pipe("a photo").images[0]

הרישיון

רישיון Apache 2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש של המודל בתוך מוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים המקורית וצירוף עותק של הרישיון, בלי דרישה לחלוק את קוד המקור של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗