GPT
S

SkyReels-V2-T2V-14B-720P

קוד פתוח

Skyworkother2025-04-18

  • diffusers
  • safetensors
  • t2v
  • text-to-video

מודל פתוח שמייצר וידאו מטקסט ברזולוציית 720P. הוא פונה למי שמחפש שליטה קולנועית בתנועות מצלמה ובזוויות צילום בלי להסתמך על שירותי ענן סגורים.

  • 14Bפרמטרים
  • 64.3 GBמשקל הקבצים
  • 2,006הורדות בחודש
  • 42לייקים

מה זה

מדובר במודל Text-to-Video מבוסס 14 מיליארד פרמטרים, שנבנה לייצור סרטונים של 121 פריימים ברזולוציה של 720 על 1280 ובקצב של 24 פריימים לשנייה. המפתחים אימנו אותו באמצעות תהליך מרובה שלבים שמשלב כוונון עדין באיכות גבוהה ולמידת חיזוק, במטרה לשפר את הדינמיקה והתנועה בפריים.

הייחוד המרכזי כאן נובע משימוש במודל ייעודי לתיאור וידאו בשם SkyCaptioner-V1. לפי נתוני הבדיקה שלהם מול 1,000 דגימות, המודל הזה מציג דיוק ממוצע של 76.3 אחוזים בהבנת הנחיות מורכבות, לעומת 58.7 אחוזים בלבד במודל רחב כמו Qwen2.5-VL-72B. היתרון מתבטא בהבנה של מושגים מקצועיים, כמו סוגי שוטים עם דיוק של 93.7 אחוזים וזוויות מצלמה עם 89.8 אחוזים. המשמעות בשטח היא שהמודל אמור להגיב טוב יותר לתיאורי בימוי מדויקים ולא רק לתיאור כללי של אובייקטים.

מתאים ל

  • הפקת קטעי הדמיה קולנועיים

    מתאים ליוצרים שרוצים לבצע הוראות בימוי מפורטות, בזכות אימון ייעודי על זוויות ותנועות מצלמה.

  • בדיקת פרומפטים מורכבים

    יעיל לחוקרים ולצוותי פיתוח עם שרתי 80 גיגה שבודקים תגובתיות של מודלי וידאו לשפה קולנועית.

  • ייצור חומרי וידאו ב־720P

    שימושי למי שחייב איכות 720P על 121 פריימים ללא שירות ענן חיצוני, ומוכן לספוג זמני עיבוד ארוכים.

איפה זה נופל

גודל המודל הוא מכשול מרכזי. נפח קבצים של 64.3 גיגה בייט ודרישות זיכרון קיצוניות הופכים את ההרצה העצמאית לבלתי אפשרית על מחשבים אישיים או כרטיסי מסך רגילים. מעבר לכך, לפי הכרטיס, תוסף הרחבת הפרומפטים נוטה לייצר טקסטים ארוכים מדי שגורמים לרוויית יתר בצבעי הווידאו. במדדי הבדיקה של ניתוח הווידאו, דיוק הבעות הפנים עומד על 68.8 אחוזים בלבד, וזיהוי תאורה על 76.5 אחוזים, נמוך יותר ממודלים מתחרים שנבדקו. מי שמצפה להבעות פנים עדינות או עקביות מושלמת ללא עיוותים יצטרך לבדוק את התוצאות ביסודיות.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא. משקלי המודל לבדם שוקלים מעל 64 גיגה בייט, ואפילו בריצה ברזולוציה נמוכה יותר של 540P המודל צורך 43.4 גיגה בייט של זיכרון וידאו. כדי להריץ את גרסת ה־720P נדרש כרטיס עם זיכרון גדול בהרבה, כמו A100 או H100 עם 80 גיגה בייט, או מערך מרובה כרטיסים.

מה ההבדל בין גרסת T2V לגרסת DF של אותה סדרה?

הגרסה הזו מיועדת ליצירת וידאו קצר באורך קבוע של 121 פריימים מתוך טקסט בלבד. גרסאות ה־Diffusion Forcing פועלות בצורה אוטורגרסיבית ומיועדות לייצור סרטונים ארוכים ורציפים של חצי דקה ויותר, בעוד המודל הנוכחי מרנדר מקטע יחיד.

איך מריצים

המשקלים תופסים מעל 64 גיגה בייט ב־19 קבצים, והרצה מקומית של גרסת 14B מחייבת חומרה כבדה מאוד. לצורך השוואה, רינדור ברזולוציית 540P בלבד דורש כ־43.4 גיגה בייט של זיכרון וידאו בשיא, כך שרינדור ב־720P על 121 פריימים ידרוש כרטיס מקצועי של 80 גיגה בייט או שימוש בכמה כרטיסים במקביל דרך כלי ההאצה xDiT USP. התהליך נעשה בפייתון דרך סקריפט ייעודי שמפעיל מנגנון Flow Matching ו־50 צעדי דה-נויזינג, יחד עם פריקת רכיבים למעבד.

אם אתם רוצים לשלב גם את מרחיב ההנחיות המבוסס על Qwen2.5-32B, תזדקקו לתוספת של מעל 64 גיגה בייט זיכרון. למי שאין אשכול שרתים ייעודי עם חומרה ברמה הזו, עדיף בהרבה להשתמש ב־Playground של החברה או לחכות לספקי תשתיות שיציעו עבורו גישה מנוהלת במחיר לפי קריאה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Skywork/SkyReels-V2-T2V-14B-720P")
img = pipe("a photo").images[0]

הרישיון

הרישיון של המשקלים מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. המשמעות היא שאין הרשאה אוטומטית לשימוש מסחרי או להפצה חוזרת בתוך מוצר. לפני שמפתחים שירות שמסתמך עליו, חובה להיכנס למאגר הגיטהאב של הפרויקט ולקרוא את נוסח הרישיון המדויק כדי לוודא אם קיימות מגבלות מסחריות או דרישות ייחוס מיוחדות.

הרישיון המלא בעמוד המודל ↗