GPT
O

OpenS2V-5M

קוד פתוח

BestWishYshcc-by-4.02025-05-15

  • subject-to-video
  • text-to-video
  • image-to-video
  • video-generation
  • large-scale

חמישה מיליון שלשות של דמות, טקסט ווידאו באיכות 720P. הוא מתאים למי שמאמן מודלים ליצירת וידאו על בסיס דמות קבועה ולא רוצה להתחיל לחתוך ולתייג מיליוני סרטונים בעצמו.

  • 24,962הורדות בחודש
  • 29לייקים

מה זה

המאגר כולל חמישה מיליון סרטונים המחולקים לשלושה עשר חלקים שונים. לצד הסרטונים יש תיאורי טקסט, תמונות רקע נקיות ומטא-דאטה מפורט שכולל מדדי תנועה, איכות אסתטית, ממדי פריים וקצב פריימים. החוקרים פילחו דמויות, יצרו זיהוי בין סרטונים שונים סביב 350 אלף צבירי דמויות, וסייעו באיסוף באמצעות יצירת נקודות מבט שונות.

הנתונים מגיעים עם חיתוכי מסיכות ותיבות גבולות בפורמט RLE שמוטמע ישירות בקובצי JSON. בנוסף לחלוקה הבסיסית, יש תת-קבוצה מסוננת לאיכות גבוהה שאינה מוגבלת רק למספר מצומצם של דגימות אלא מפוזרת על פני כל המאגר לפי ספי סינון הניתנים להתאמה.

מתאים ל

  • אימון מודלי Subject-to-Video

    שמירה על עקביות של דמות מסוימת לאורך סרטון שלם באמצעות קישור בין סצנות שונות.

  • יצירת וידאו מטקסט

    אימון מודלים גנרטיביים סטנדרטיים של טקסט לווידאו ברזולוציית 720P על בסיס מיליוני שלשות.

  • פילוח והסרת רקעים בווידאו

    שימוש בתמונות הרקע הנקיות ובמסיכות ה־RLE לאימון מודלים של החלפת רקע ועריכת וידאו.

איפה זה נופל

יש פה פשרות טכניות בולטות שמשפיעות על האימון. חלקים 1 עד 9 נשמרו ללא אודיו כדי לחסוך מקום, ורק חלקים 10 עד 13 כוללים קול. תמונות הדמויות שנחתכו כוללות את ראש האדם בלבד ולא את הפנים לבדן, כך שצריך להריץ מודל חיתוך פנים ייעודי בזמן האימון. בנוסף, זוגות הפריימים שנוצרו עם GPT לא שוחררו ישירות במאגר אלא דורשים הפקת סקריפט עצמאית, והתיאורים מוגבלים לשפה האנגלית.

שאלות
נפוצות

האם המאגר מכיל עברית?

לא, המאגר כולל תיאורי טקסט באנגלית בלבד. אם המטרה היא יצירת תוכן מבוסס פרומפטים בעברית, תצטרכו לתרגם את התיאורים בעצמכם או להסתמך על מודל שפה חיצוני שמבצע תרגום לפני שלב היצירה.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, רישיון CC-BY-4.0 מאפשר שימוש מסחרי מלא כולל אימון מודלים פנימיים או פתוחים. הדרישה המרכזית היא מתן קרדיט ברור ליוצרי המאגר במקומות הנדרשים ולציין שנעשה שימוש בנתונים שלהם.

האם הסרטונים כוללים פסקול שמע?

רק חלק קטן מהם כולל סאונד. היוצרים השמיטו את האודיו מחלקים 1 עד 9 כדי לצמצם נפחי אחסון, ורק חלקים 10 עד 13 שמרו על ערוץ השמע המקורי.

האם הסרטונים מוכנים לטעינה ישירה לרשת?

ממש לא, הקבצים הגדולים מפוצלים ומחייבים איחוד בקוד והרצת חיתוך מרחבי וזמני לפי ערכים בקובצי המטא-דאטה. ללא הפעלת החיתוך הזה, הסרטונים יכללו חיתוכי סצנות וסימני מים שיפגעו באימון.

איך טוענים

אין צורך באישור גישה מיוחד, אך ההורדה והעיבוד דורשים תשתיות אחסון כבדות ומאמץ ידני. המאגר מורכב מ־1,026 קבצים, כולל ארכיוני tar מפוצלים שחייבים לאחד בפקודת cat לפני החילוץ. נתוני הווידאו דורשים חיתוך בזמן אמת לפי קואורדינטות וטווחי פריימים המוגדרים בקובצי ה־JSON כדי להסיר סימני מים ומעברי סצינות חדים. כדי לעבוד ביעילות, תצטרכו להשתמש בסקריפטים של מחוללי הדאטה שהחוקרים פרסמו לצד ספריות וידאו כמו decord.

from datasets import load_dataset

ds = load_dataset("BestWishYsh/OpenS2V-5M")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים ומצוינים השינויים שבוצעו. אין חובה לשתף נגזרות באותו הרישיון, מה שמאפשר להשתמש בנתונים לאימון מודלים מסחריים וקנייניים ללא פתיחת קוד המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗