GPT
V

Vript

קוד פתוח

Mutonixרישיון לא דווח2024-04-10

המאגר כולל כ־400 אלף קטעי וידאו מתויגים ברמת תסריט קולנועי מפורט. הוא מתאים למי שמאמן מודלי וידאו וצריך הבנה של זוויות צילום, תנועת מצלמה ותמלול מלא של הסצנה.

  • 16,253הורדות בחודש
  • 27לייקים

מה זה

הנתונים מחולקים ל־12 אלף סרטונים מלאים ברזולוציית 720p ולקטעים גזורים שמתאימים לכל סצנה. המקור מגיע מיוטיוב לסרטונים הארוכים, ומיוטיוב שורטס ומטיקטוק לסרטונים הקצרים. בניגוד לתיאורים כלליים קצרים, כאן יש פירוק צפוף לכל סצנה בלי לדלג על חלקים, עם ממוצע של כ־145 מילים לתיאור סצנה.

המבנה של כל רשומה כולל מטא-דאטה של מזהה הסרטון והכותרת, לצד תיוג ספציפי של סוג השוט, תנועת המצלמה, תוכן המתרחש, כותרת הסצנה ותמלול קולי שהופק בדיבוב. בנוסף יש קובצי מטא שמפרטים את זמני ההתחלה, הסיום והמשך של כל חיתוך, לצד קובצי תמלול אוטומטי.

מתאים ל

  • אימון מודלי יצירת וידאו

    התאמת תנועות מצלמה וסוגי שוטים להנחיות טקסטואליות מדויקות עבור מודלי טקסט לווידאו.

  • הבנת וידאו רב-מודאלית

    שילוב בין תמלול קולי לניתוח חזותי עבור מענה על שאלות וסיווג פעולות מורכבות בסרטונים.

  • יצירת תסריטים אוטומטית

    פירוק תוכן חזותי ארוך לתיאורי סצנה מובנים שמפרטים תנועה, מיקום ודיאלוגים.

איפה זה נופל

כל הטקסט והתמלולים במאגר הם באנגלית בלבד, ואין כאן שום תמיכה בעברית או בשפות אחרות. הנתונים מבוססים על תוכן רשת ציבורי מפלטפורמות וידאו מסחריות, עם כל ההטיות הטיפוסיות לתוכן ויראלי ורשתות חברתיות. איכות הווידאו מוגבלת כרגע לרזולוציית 720p בלבד, וחלק מהקטעים לא כוללים תיוג מלא אם שדה השלמות מסומן כשלילי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון של המאגר אוסר זאת במפורש. השימוש מוגבל למחקר אקדמי בלבד, ואסור לשכפל או להפיץ את התכנים למטרות רווח. כל שימוש מעבר למחקר טהור חושף אתכם לתביעות מצד יוצרי הסרטונים המקוריים.

כמה שטח אחסון צריך להכין כדי להוריד את המאגר?

תצטרכו לפחות 1.5 טרה-בייט פנויים רק עבור קובצי הווידאו המכווצים. הסרטונים הארוכים והחיתוכים שלהם תופסים קרוב ל־1.5 טרה-בייט, והסרטונים הקצרים תופסים כ־20 ג'יגה-בייט נוספים. מומלץ להחזיק נפח כפול כדי שתוכלו לחלץ את הקבצים ולעבוד איתם בפועל.

האם הדאטהסט כולל תוכן בעברית?

המאגר מוגדר כולו באנגלית ואינו מכיל תיוגים בעברית. התמלולים הקוליים והתיאורים המילוליים נאספו מסרטונים באנגלית מפלטפורמות כמו יוטיוב וטיקטוק. אם אתם מכוונים למודל שמבין עברית, תצטרכו לתרגם את הנתונים או לחפש מקור אחר.

מאיפה הגיעו הסרטונים ואיך חילקו אותם?

הסרטונים הארוכים נאספו מיוטיוב, בעוד הסרטונים הקצרים הגיעו מיוטיוב שורטס ומטיקטוק. היוצרים חתכו את הסרטונים לסצנות בודדות לפי נקודות זמן קבועות וחילקו אותם לקובצי ארכיון של 10 או 50 סרטונים בכל קובץ. לכל סצנה הוצמד תמלול קולי לצד ניתוח אופן הצילום והתנועה.

איך טוענים

ההורדה מורכבת מאלפי קובצי ארכיון מכווצים ששוקלים יחד מעל טרה-בייט וחצי. סרטוני המקור הארוכים שוקלים 667 ג'יגה-בייט והקטעים החתוכים שלהם מוסיפים עוד 822 ג'יגה-בייט, לצד הסרטונים הקצרים שתופסים כ־20 ג'יגה-בייט נוספים. התיוגים יושבים בקובצי jsonl ו־json מסודרים. שימו לב שהיוצרים מציינים שחלק מקובצי ה־zip עשויים להכיל תיקיות ריקות שאפשר להתעלם מהן, ושדה ה־integrity מציין אם כל הסצנות בסרטון מסוים אכן תויגו במלואן.

from datasets import load_dataset

ds = load_dataset("Mutonix/Vript")

הרישיון

המאגר סגור לחלוטין לשימוש מסחרי ומוגדר לצרכי מחקר אקדמי בלבד. אסור להפיץ, לשדר, לשנות או לסחור במידע, ואין רישיון קוד פתוח מוכר. אם תאמנו עליו מודל לצורך מוצר מסחרי, אתם מסתכנים בהפרת תנאי השימוש וזכויות היוצרים של בעלי הסרטונים המקוריים.

הרישיון המלא ב־Hugging Face ↗