GPT
V

VACE-Wan2.1-1.3B-Preview

קוד פתוח

ali-vilabapache-2.02025-04-01

  • diffusers
  • safetensors
  • t2v
  • video generation
  • video-to-video editing

הכלי מייצר ועורך וידאו מסרטונים, תמונות רפרנס ומסכות ישירות על בסיס Wan2.1. הוא מציע פתרון מקומי וקומפקטי יחסית בלי להסתמך על מודלי ענק סגורים.

  • 2.2Bפרמטרים
  • 17.7 GBמשקל הקבצים
  • 858הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל עריכה ויצירה שמשלב כמה משימות תחת קורת גג אחת, כולל עריכת וידאו לווידאו, עריכה עם מסכות ומעקב אחרי תמונות רפרנס. במקום לאמן מודל נפרד לכל פעולה כמו החלפת אובייקט או הנפשה, הוא מקבל טקסט יחד עם וידאו מקור, תמונת מקור ומסכה, ומבצע את המניפולציה בריצה אחת.

הבסיס כאן הוא ארכיטקטורת Wan2.1 בגרסת 1.3B, מה שמשאיר אותו קל יחסית למודלי וידאו מודרניים. הוא פועל בעיקר באנגלית ובסינית, ומתמקד ברזולוציית יעד של סביב 480 על 832 פיקסלים ל־81 פריימים. המשמעות היא שלא מדובר במפיק קולנועי לאיכות מקסימלית, אלא במנוע שמיועד לתת תוצאות תנועה ועריכה מהירות יחסית במחיר חישובי סביר.

מתאים ל

  • עריכת אובייקטים מקומית

    מחיקה או החלפה של אלמנטים מתוך סרטון קיים באמצעות מסכות מוגדרות ותיאור טקסטואלי.

  • הנפשת תמונות רפרנס

    יצירת וידאו מונפש ששומר על הדמויות והסגנון מתוך תמונת מקור בודדת.

  • בדיקת היתכנות מקומית

    פיתוח כלי וידאו בתוך הארגון על גבי חומרה מקומית סבירה ובלי להוציא נתונים החוצה.

איפה זה נופל

המודל הזה הוא גרסת תצוגה מקדימה, מה שאומר שיציבות התוצאות מוגבלת. הרזולוציה המיטבית עומדת על 480 על 832 פיקסלים בלבד, כך שאי אפשר לצפות לווידאו חד באיכות גבוהה. בנוסף, משתמשים באנגלית חייבים להפעיל הרחבת הנחיות טקסטואליות כדי לקבל תוצאות סבירות, והמערכת מחייבת הורדת מודלים נוספים לעיבוד מקדים לפני שבכלל מגיעים להסקה.

שאלות
נפוצות

האם אפשר לייצר איתו סרטונים ברזולוציית Full HD?

לא מומלץ. אמנם הקלט תומך ברזולוציות שונות, אך הביצועים הטובים ביותר של הגרסה הזו מוגבלים לסביבות 480 על 832 פיקסלים. בשביל איכות 720p או 1080p צריך להמתין לגרסאות הגדולות יותר כמו 14B.

איך מקבלים תוצאות טובות יותר בהזנת הנחיות באנגלית?

המפתחים מציינים שבשימוש באנגלית יש להפעיל את הדגל use_prompt_extend בזמן הריצה. האפשרות הזו מרחיבה את הטקסט כדי לנצל את מלוא היכולת של מודל השפה הפנימי.

איך מריצים

בשביל להריץ אותו צריך סביבת לינוקס עם פייתון 3.10, גרסת PyTorch 2.5.1 ומעלה ו־CUDA 12.4. הקבצים עצמם שוקלים 17.7 גיגהבייט ומכילים כ־2.2 מיליארד פרמטרים. מומלץ להצטייד במעבד גרפי עם לפחות 24 גיגהבייט זיכרון כדי לטעון אותו ואת מודל הבסיס יחד, או לחבר שרת עם כמה כרטיסים באמצעות חבילת xfuser אם רוצים לקצר את זמני הרינדור.

ההרצה דורשת שלב מקדים של עיבוד קלטים באמצעות כלי Annotators נפרדים שמייצרים את המסכות והעומק. אם המטרה היא שילוב נקודתי בכלי קיים בלי לנהל תלויות כבדות, דרישות תשתית ותחזוקת ספריות, שימוש בשרת ענן ייעודי יחסוך הרבה כאב ראש סביב ניהול הזיכרון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ali-vilab/VACE-Wan2.1-1.3B-Preview")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות שימוש מעיקות מעבר לדרישות המקובלות בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗