GPT
V

VideoChat-Flash-Training-Data

קוד פתוח

OpenGVLabapache-2.02025-02-12

המאגר מרכז סרטונים והערות טקסט לאימון מודלים של וידאו ושיחה. הוא מיועד למי שבונה מודל להבנת הקשרים ארוכים בווידאו וצריך דאטה מוכן למשימות מעקב וטקסט.

  • 10,631הורדות בחודש
  • 16לייקים

מה זה

המאגר כולל את נתוני האימון של הפרויקט, עם מעל שמונים וארבעה אלף קבצים שמכילים הערות טקסט ואת מרבית הווידאו עצמו. המבנה מורכב מקובצי אנוטציות בפורמט ג'ייסון לצד ספריות וידאו שונות, וחלק ניכר מהחומרים נשען על מקורות קיימים מעולמות הראייה הממוחשבת. אפשר למצוא שם נתונים כמו שחזורי כתוביות של לאבה, דוגמאות מתוך אלאבה, בליפ, וקובצי פיקס ייעודיים לתמונות ווידאו.

הכרטיס לא מפרט תהליך סינון מסודר או מתודולוגיית ניקוי שנערכה על הנתונים, אלא מציג איסוף ישיר של כמה תת מאגרים. חלוקת הקבצים מראה הפרדה ברורה בין תמונות עם טקסט לבין מקטעי וידאו ארוכים שמגיעים ממקורות כמו קוין ואגו ארבע די, המיועדים להבנת אירועים וקרקוע של פעולות בציר הזמן.

מתאים ל

  • אימון מודלים לווידאו ארוך

    חיבור מקטעי וידאו עם אנוטציות של אירועים כדי לאמן מודל להבין רצף התרחשויות.

  • מעקב פעולות וקרקוע

    שימוש במאגרי זיהוי כמו קוין כדי ללמד מודלים לאתר פעולה ספציפית בתוך קטע.

  • כוונון שיחה על תמונות

    שימוש בקובצי ההוראות של לאבה ואלאבה לצורך פיין טיונינג של מודלי שפה וראייה.

איפה זה נופל

הנתונים מוגדרים כולם באנגלית, בלי תמיכה בעברית או בשפות אחרות. הכרטיס לא חושף הטיות, לא מסביר איך דגמו את הפריימים ולא מפרט על סינון תוכן בעייתי מתוך מקורות הרשת. מי שמתכנן להכניס את התוצרים למוצר אמיתי יצטרך לבדוק בעצמו את טיב הטקסט והתאמתו לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא אפאצ'י שתיים אפס שמתיר שימוש מסחרי חופשי. עם זאת, יש חובה לצרף ייחוס ועותק מהרישיון המקורי בקוד או במוצר.

האם יש במאגר תמיכה בעברית?

לא, השפה הרשמית המוגדרת היא אנגלית בלבד. כל האנוטציות והוראות הטקסט שנמצאות בקובצי הג'ייסון נכתבו באנגלית.

איך פותחים את קובצי הווידאו של הנתונים הארוכים?

חלק מהווידאו מגיע בחלקים מפוצלים תחת תיקיות ייעודיות. צריך להשתמש בפקודת שרשור בסיסית במערכת ההפעלה כדי לאחד אותם לקובץ זיפ אחד לפני החילוץ.

מאיפה נאספו הנתונים במאגר?

הנתונים נשענים על כמה מאגרים קיימים כמו סטים של לאבה, בליפ, אגו ארבע די וקוין. המפרסמים לא תיעדו תהליך סינון ייחודי אלא ריכזו את המקורות יחד.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה מתוך הראפו. הקבצים מחולקים למבנה ספריות רחב, וכדי להשתמש בווידאו הארוך צריך לחבר חלקי קבצים ידנית באמצעות פקודת שרשור בטרמינל לפני החילוץ. העבודה דורשת סנכרון בין קובצי הג'ייסון שבתיקיית האנוטציות לבין קובצי המדיה שנמצאים בתיקיות המשנה.

from datasets import load_dataset

ds = load_dataset("OpenGVLab/VideoChat-Flash-Training-Data")

הרישיון

המאגר מוגדר ברישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים פנימיים ומסחריים, לשנות אותו ולהפיץ הלאה, כל עוד שומרים על הודעת זכויות היוצרים והייחוס המקורי. המודלים שמאמנים עליו אינם מחויבים בשיתוף תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗