GPT
V

VBVR-Dataset

קוד פתוח

Video-Reasonapache-2.02026-02-24

  • video-reasoning
  • video-generation
  • visual-reasoning
  • benchmark
  • spatiotemporal

מיליון סרטונים שנועדו ללמד מודלי וידאו להבין חוקיות פיזיקלית וגאומטרית. המטרה כאן היא אימון יכולות חשיבה והסקה, ולא סתם יצירת פריימים שנראים טוב לעין.

  • 554הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל בדיוק מיליון דוגמאות אימון שמגיעות מתוך מאה מחוללי משימות שונים, עשרת אלפים דוגמאות מכל מחולל. הנתונים מחולקים לשתי קבוצות עיקריות, משימות גאומטריה וגרפים שכוללות שישים ושלושה מחוללים, ומשימות פיזיקה ואובייקטים שמכסות שלושים ושבעה מחוללים נוספים. שמות הקבצים מעידים על תוכן סינתטי מובהק, כמו מעקב אחרי חפצים שנעלמים ומופיעים, רצפי גדלים של צורות או השלמת מקטעים חסרים.

כל רשומה בודדת בנויה מחמישה קבצים: תמונת הפריים הראשון, תמונת הפריים האחרון, סרטון מלא שמציג את רצף הפעולה, קובץ טקסט עם שאלת ההסקה או ההוראה, וקובץ נתונים מובנה שמתעד את הפרמטרים ששימשו ליצירת הדוגמה. הכל מגיע מתהליכי יצירה אוטומטיים ומבוקרים, בלי סרטונים שצולמו בעולם האמיתי.

מתאים ל

  • אימון מודלי וידאו להסקה

    לימוד מודלים להשלים תנועה בין פריים ראשון לאחרון לפי כללים גאומטריים.

  • מבחני הבנה פיזיקלית

    בדיקת יכולת המודל לחזות תנועת אובייקטים והיעלמותם במרחב לפי חוקים מוגדרים.

  • מענה לשאלות על וידאו

    הזנת שאלת ההסקה המצורפת יחד עם הווידאו כדי לפתח יכולות VQA טכניות.

איפה זה נופל

הטקסט כולו באנגלית וכל הווידאו סינתטי לחלוטין. אם המטרה שלכם היא מודל שמבין סרטונים מהעולם האמיתי, עם תאורה טבעית, תנועות מצלמה מורכבות או התנהגות אנושית, הדאטהסט הזה לא יספיק לבד. הוא מיועד לבדיקת היגיון צורני ופיזיקלי מבוקר, וכך צריך להתייחס אליו לפני שמשקיעים שעות של אימון.

שאלות
נפוצות

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט שוחרר תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, מחקרי ופרטי ללא תשלום. הדרישה העיקרית היא הוספת הקרדיט המקורי ושמירה על תנאי הרישיון בהפצה.

כמה מקום צריך לפנות בדיסק?

קבצי המדיה הדחוסים שוקלים כ־370 גיגה-בייט במאה קובצי tar שונים. לאחר חילוץ חמשת מיליון הקבצים תצטרכו נפח אחסון גדול משמעותית, ולכן מומלץ לחלץ רק את המחוללים שאתם באמת צריכים.

האם יש במאגר תמיכה בעברית?

לא. כל הוראות ההסקה, השאלות והמטא-דאטה מנוסחים באנגלית בלבד. אם אתם צריכים בדיקה בעברית, תידרשו לתרגם את קובצי הטקסט באופן עצמאי.

מאיפה הגיעו הסרטונים?

הווידאו לא צולם במציאות ולא נאסף מהרשת. כל מיליון הדוגמאות נוצרו באופן פרוצדורלי על ידי מאה מחוללי קוד ייעודיים שפותחו לצורך הפרויקט, תוך שליטה בפרמטרים כמו צורות, גדלים ותנועה.

איך טוענים

טעינת המטא-דאטה מתבצעת ישירות דרך ספריית datasets מתוך קובץ parquet מרכזי, בלי צורך להוריד מדיה כבדה. המאגר פתוח לציבור ואין צורך לבקש אישור גישה מראש. אם אתם רוצים את הסרטונים עצמם, הסיפור שונה לגמרי: המדיה ארוזה במאה קובצי tar נפרדים, אחד לכל מחולל, בנפח דחוס של כ־370 גיגה-בייט. הדרך המעשית לעבוד איתו היא לבחור מחוללים ספציפיים דרך huggingface_hub ולפתוח מקומית רק את החבילות הרלוונטיות למשימה שלכם.

from datasets import load_dataset

ds = load_dataset("Video-Reason/VBVR-Dataset")

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בדאטהסט לאימון מודלים מסחריים, לבצע שינויים ולשלב אותו במערכות פנימיות בלי חובת שיתוף של הקוד שלכם, ובלבד שתשמרו על הודעת הרישיון ומתן קרדיט למחברים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗