GPT
L

LLaVA-OneVision-2-Data

קוד פתוח

mvp-labapache-2.02026-03-24

  • llava
  • multimodal
  • video
  • spatial-reasoning

מאגר אימון מולטימודלי עצום של וידאו ותמונות עבור LLaVA-OneVision-2. הוא מספק קטעי וידאו מגוונים לפי אורכים, כתוביות מפורטות ומידע להבנה מרחבית.

  • 120,921הורדות בחודש
  • 38לייקים

מה זה

המאגר מחולק לשני חלקים בגלל נפחו, כאשר החלק הראשון מרכז קטעי וידאו של כשישים שניות, כתוביות לכל טווחי הזמנים, מיפויים ונתוני הבנה מרחבית. נתוני הווידאו מאורגנים בארכיוני WebDataset ומכסים חלוקות של 30 שניות, 60 שניות, שלוש דקות ומעל עשר דקות. המיפויים בקובצי CSV מקשרים כל סרטון למזהה יוטיוב ולחלון הזמן המקורי שלו.

נתוני ההבנה המרחבית מגיעים ב־84 קובצי ארכיון ומכסים משימות כמו refcoco, Visual Genome, הצבעה והבנת תלת מימד. בנוסף, קובצי JSONL מרכזים את הכתוביות שנכתבו עבור הסרטונים השונים. הכרטיס לא מפרט על תהליכי סינון אוטומטיים או ידניים שבוצעו על הווידאו.

מתאים ל

  • אימון הבנת וידאו ארוך

    אימון מודלים מולטימודליים על רצפי וידאו של דקות ארוכות באמצעות כתוביות מותאמות.

  • הבנה מרחבית בתמונות

    שיפור יכולות איתור אובייקטים במרחב ותלת מימד בעזרת ארכיוני spatial הייעודיים.

  • מענה על שאלות חזותיות

    אימון על משימות visual question answering המשלבות טקסט ווידאו באורכים שונים.

איפה זה נופל

הנתונים כוללים טקסטים באנגלית בלבד, ואין כאן תמיכה בעברית. מקור הווידאו הוא יוטיוב, מה שמביא איתו הטיות תוכן ואיכות טיפוסיות לרשת. הכרטיס לא מדווח על תאריכי הדגימה של הסרטונים או על בדיקות בטיחות וסינון תוכן פוגעני. בנוסף, חלקי הווידאו הארוכים בחלק השני לא הועלו במלואם, חסרים שם עשרות קבצים להשלמת הסט, והנפח העצום מקשה מאוד על בדיקה מדגמית של החומר לפני אימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמאפשר שימוש מסחרי מלא. אתם צריכים רק לספק ייחוס מתאים ולצרף עותק של הרישיון.

כמה שוקל הדאטהסט המלא?

החלק הראשון מכיל מעל עשרת אלפים קובצי ארכיון של סרטונים קצרים, בעוד שאר הווידאו הארוך במאגר Part2 שוקל לבדו מעל 84 טרה-בייט. תצטרכו תשתית אחסון רצינית מאוד אם תרצו להוריד הכל.

האם יש במאגר תמיכה בעברית?

לא. הכתוביות והמשימות מוגדרות באנגלית בלבד, וסביר להניח שגם רוב הווידאו מיוטיוב מתמקד באנגלית.

האם כל הקבצים הועלו למאגר במלואם?

לא לגמרי. הכרטיס מציין שבחלק השני של הווידאו הארוך חסרים כמה עשרות קובצי tar מתוך היעד הסופי, כך שצריך לבדוק את התיקייה לפני תחילת ריצה.

איך טוענים

טוענים את הנתונים ישירות דרך כלי שורת הפקודה של Hugging Face, תוך התמקדות בתיקיות הספציפיות שאתם צריכים. הווידאו מאוחסן באלפי קובצי tar בפורמט WebDataset, והכתוביות זמינות ב־JSONL לצד קובצי מיפוי ב־CSV. нет צורך באישור גישה מיוחד, המאגר פתוח. אם אתם צריכים סרטונים ארוכים, קובצי הווידאו עצמם נמצאים במאגר Part2, ששוקל עשרות טרה-בייטים, ומחייבים הצלבה לפי נתיב הקובץ מול הכתוביות שנמצאות במאגר הזה.

from datasets import load_dataset

ds = load_dataset("mvp-lab/LLaVA-OneVision-2-Data")

הרישיון

המאגר מפורסם ברישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב שיתוף באותו רישיון. נדרש לתת ייחוס מתאים למפרסמים ולכלול עותק של הרישיון. מודלים שתאמנו על הדאטהסט אינם כפופים לפתיחת המשקלות שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗