GPT
V

VideoMind-Dataset

קוד פתוח

yeliudevbsd-3-clause2025-03-21

המאגר מרכז סרטונים ותיוגים מגוונים לאימון והערכה של מודלים להבנת וידאו בזמן. הוא חוסך איסוף ידני ומציע גרסאות קלות ללא שמע לצד הקבצים המקוריים.

  • 8,454הורדות בחודש
  • 25לייקים

מה זה

המאגר מציע אוסף עצום של סרטונים ותיוגים שמחולק לשלושה חלקים עיקריים. החלק הראשון מיועד לאימון מודל הסקת מסקנות בווידאו וכולל 481 אלף דוגמאות שמחולקות לרכיבי מיקום בזמן, אימות ותכנון, מתוך מקורות מוכרים כמו QVHighlights, DiDeMo ו־TACoS.

החלק השני מוקדש להערכת ביצועים במגוון משימות, כולל מענה על שאלות מבוססות וידאו ומשימות איתור זמני. החלק השלישי מכיל דאטהסטים נוספים מעולם הווידאו שהועלו לטובת הקהילה, ביניהם נתונים מסביבות אגוצנטריות כמו Ego4D וסרטוני הדרכה מ־YouCook2 ו־COIN. כל הסרטונים זמינים בקבצים המקוריים שלהם וגם בגרסה דחוסה של 480p בקצב של 3 פריימים לשנייה ללא ערוץ שמע.

מתאים ל

  • איתור רגעים בווידאו

    אימון מודלים לזיהוי ותיחום זמני של פעולות ספציפיות בתוך סרטונים ארוכים לפי תיאור טקסטואלי חופשי.

  • מענה על שאלות מורכבות

    בניית מודלי שפה וראייה שמסוגלים להבין עלילה בווידאו, לענות על שאלות ולהסביר את התשובה מתוך הפריימים.

  • בנצ׳מרק להערכת מודלים

    בדיקת ביצועים השוואתית של מודלי מולטימודל על בנצ׳מרקים תקניים כמו CG-Bench ו־Video-MME.

איפה זה נופל

אם אתם צריכים לנתח ערוצי שמע, הגרסה המכווצת של 3 פריימים לשנייה לא תעזור לכם כי מחקו ממנה את פס הקול לגמרי. בנוסף, מדובר באוסף שמורכב ממקורות חיצוניים שונים שחלקם דורשים התאמות ספציפיות, ולעיתים הסרטונים והתיוגים שמורים בתיקיות נפרדות שדורשות סינכרון ידני. אין במאגר שום תמיכה בעברית, כל הטקסטים והתיוגים באנגלית, ודאטהסטים שמגיעים מהרשת כוללים הטיות מובנות של סרטוני יוטיוב וצילום ביתי מערבי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מוגדר תחת רישיון BSD-3-Clause שמאפשר שימוש מסחרי עם מתן קרדיט. עם זאת, הוא מכיל סרטונים מדאטהסטים אקדמיים שונים, וחלק מהמקורות המקוריים עשויים להגביל שימוש מסחרי, כך שצריך לבדוק כל תיקייה לחוד.

האם יש תמיכה בעברית?

לא. כל השאלות, התיוגים והתיאורים הם באנגלית בלבד. אם תרצו לאמן מודל שיבין עברית, תצטרכו לתרגם את קובצי ה־JSON בעצמכם או לבצע התאמות ייעודיות.

מה ההבדל בין גרסאות הווידאו השונות במאגר?

היוצרים מציעים שני עותקים של הסרטונים. ישנם הקבצים המקוריים באיכות המלאה, ויש גרסה דחוסה ברזולוציית 480p, קצב של 3 פריימים לשנייה וללא ערוץ שמע, שמתאימה למי שרוצה לחסוך זמן הורדה ושטח דיסק.

איך פותחים את קובצי הווידאו שהורדו?

הסרטונים ארוזים בקובצי ארכיון מפוצלים עם סיומות כמו .00 ו-.01. כדי לחלץ אותם מחברים את החלקים באמצעות פקודת cat ומעבירים ישירות לחילוץ ב־tar לפי הדוגמה בעמוד המאגר.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. המאגר מורכב מ־247 קבצים שמחולקים לפי תיקיות של הדאטהסטים השונים, כולל קובצי תיוג בפורמט JSON וארכיונים מפוצלים של סרטונים. כדי לחלץ את הווידאו צריך לאחד את החלקים המפוצלים בפקודת cat פשוטה בטרמינל ולפתוח עם tar. כדאי להוריד רק את התיקיות שרלוונטיות למשימה שלכם, במיוחד אם אתם בוחרים בגרסה המכווצת כדי לחסוך מקום ואחסון מקומי.

from datasets import load_dataset

ds = load_dataset("yeliudev/VideoMind-Dataset")

הרישיון

המאגר מופץ ברישיון BSD-3-Clause, שמתיר שימוש מסחרי ומחקר חופשי בלי דרישה לשיתוף קוד המקור שלכם, בתנאי שתשמרו על הודעת זכויות היוצרים ונוסח הרישיון. שימו לב שהמאגר מרכז תכנים מדאטהסטים חיצוניים רבים כמו Ego4D או ActivityNet, ולכן מומלץ לבדוק את תנאי השימוש המקוריים של כל מקור בנפרד לפני אימון מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗