GPT
S

SkyReels-V3-A2V-19B

קוד פתוח

Skyworkother2026-01-19

  • diffusers
  • safetensors
  • i2v
  • image-to-video

המודל מייצר סרטוני אווטאר מדבר מתמונה אחת וקובץ אודיו של עד 200 שניות ברזולוציית 720p. הוא מיועד למי שצריך תנועות שפתיים מדויקות ומבעי פנים טבעיים באנימציה מבוססת קול.

  • 19Bפרמטרים
  • 52.1 GBמשקל הקבצים
  • 2,121הורדות בחודש
  • 98לייקים

מה זה

מדובר במודל דיפוזיה מבוסס Transformer בהיקף של 19 מיליארד פרמטרים, שממיר תמונה בודדת ורצועת קול אחת לווידאו בקצב של 24 פריימים לשנייה. המערכת מייצרת אנימציה של דמויות אנושיות, איורים או בעלי חיים תוך התאמת תנועות השפתיים לקול, הבעות פנים ותנועות מצלמה לפי הנחיית טקסט.

בסדרת V3 המודל הזה ספציפית אמון על תחום ה־Talking Avatar, לצד מודלים נפרדים של 14B שמיועדים להמשכת וידאו או יצירה ממספר תמונות רפרנס. הוא משתמש במסגרת שמגדירה תחילה פריימי מפתח כדי לשמור על יציבות הדמות לאורך סרטונים ארוכים יחסית.

במדדי ההשוואה הפנימיים של המפתחים מול מודלים כמו OmniHuman 1.5, KlingAvatar ו־HunyuanAvatar, המודל קיבל ציון של 8.18 בסנכרון קול־תמונה לעומת 8.25 של OmniHuman, ציון איכות ויזואלית של 4.60 ועקביות דמות של 0.80. בפועל, התוצאות מציגות ביצועים קרובים מאוד למודלים מובילים בתעשייה, במיוחד בדיוק הדיבוב ובשמירה על מבנה הפנים.

מתאים ל

  • הנפשת דמויות וירטואליות

    הפיכת איור, דמות אנימה או אווטאר מותג לסרטון דיבור חי על בסיס קובץ קול והנחיית טקסט.

  • סרטוני הדרכה וקריינות

    יצירת סרטוני הסבר באורך של עד שלוש דקות מתמונת מרצה והקלטת אודיו, ללא צורך בצילום וידאו באולפן.

  • הפקת תוכן קולי מרובה שפות

    יצירת תנועות שפתיים מותאמות להקלטות קול קיימות עבור סרטונים המיועדים להפצה ברשתות חברתיות.

איפה זה נופל

המודל תומך בהזנה של רצועת אודיו בודדת בלבד ומוגבל לאורך של עד 200 שניות. הטקסט השיווקי מתאר תמיכה בריבוי דמויות, אך מנגנון ההרצה המוצג מתבסס על שחקן יחיד ותמונת פתיחה אחת. סנכרון תנועות השפתיים מצוין בדוחות בעיקר עבור אנגלית, סינית וקוריאנית, כך שאין שום נתון על איכות הסנכרון בדיבור בעברית. בנוסף, הרצה מקומית על כרטיס בודד ללא שרת ייעודי מחייבת פשרות באיכות כמו מעבר ל־FP8 והורדת הרזולוציה מתחת ל־720p.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי כמו RTX 4090?

אפשר, אבל תצטרכו להפעיל את הדגל low_vram כדי לדחוס את המשקולות ל־FP8 ולהשתמש ב־offload לזיכרון ה־RAM. כדי שההרצה תעבור בצורה יציבה ללא קריסות זיכרון, מומלץ גם להוריד את רזולוציית היצירה ל־540P במקום 720P.

האם המודל הזה מתאים גם להרחבת סרטונים קיימים?

לא. המודל הספציפי הזה, SkyReels-V3-A2V-19B, מאומן למשימת Talking Avatar מקובץ קול ותמונה. עבור הרחבת וידאו או מעברי שוטים צריך להוריד את מודל ה־V2V הייעודי של הסדרה, שמגיע בגודל של 14B פרמטרים.

איך מריצים

כדי להריץ מודל של 19 מיליארד פרמטרים עם קבצים במשקל 52.1 גיגה־בייט, צריך חומרת שרתים חזקה. ההרצה דורשת סביבת Python 3.12 ומעלה עם CUDA 12.8 פלוס, ונתמכת דרך diffusers או קוד ההסקה הרשמי עם תמיכה בריבוי כרטיסים באמצעות xDiT USP.

לכרטיסים עם פחות מ־24GB של VRAM, הקוד כולל מצב low_vram שמפעיל קוונטיזציה של המשקולות ל־FP8 ודחיקת בלוקים לזיכרון המערכת, לצד המלצה להוריד את הרזולוציה ל־540P או 480P. אם אין לכם גישה לכרטיסי שרת עם זיכרון גבוה או שאינכם רוצים להתמודד עם זמני רינדור ארוכים מקומית, עדיף להשתמש ב־API שהמפתחים פרסמו בפלטפורמת apifree.ai.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Skywork/SkyReels-V3-A2V-19B")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ואינו רישיון קוד פתוח סטנדרטי מוכר כמו MIT או Apache 2.0. המשמעות היא שחובה לבדוק את תנאי השימוש המדויקים במאגר הקוד של Skywork לפני שמשלבים את המודל במוצר מסחרי, שכן ייתכנו הגבלות על שימוש מסחרי, הפצה מחדש או שימוש מסחרי בהיקף גבוה.

הרישיון המלא בעמוד המודל ↗