GPT
L

LLaVA-Video-178K

קוד פתוח

lmms-labרישיון לא דווח2024-08-27

  • video

מאגר נתונים רחב לחיבור בין טקסט לווידאו, שנועד לאימון מודלים מולטימודליים על מטלות של תיאור סרטונים ושאלות פתוחות או אמריקאיות. הוא מרכז קבצי וידאו עם מאות אלפי שאלות ותשובות שנוצרו בסיוע בינה מלאכותית.

  • 27,780הורדות בחודש
  • 202לייקים

מה זה

המאגר כולל 178,510 תיאורי וידאו, לצד 960,792 פריטי שאלות ותשובות פתוחות ועוד 196,198 שאלות רב ברירה שנוצרו במיוחד עבור הפרויקט. הנתונים מחולקים למקורות אקדמיים ולסרטוני יוטיוב, ומאורגנים לפי אורכי סרטונים, למשל מקטע של אפס עד שלושים שניות. המפתחים יצרו את התיאורים והשאלות באמצעות פקודות שהופנו למודל GPT-4o, והם מצרפים גם את הפרומפטים ששימשו להפקה.

בנוסף לחומרים החדשים, המאגר מאגד גרסאות מעובדות של דאטהסטים קיימים כדי לאפשר שחזור מלא של אימון מודל הווידאו. תמצאו כאן אלפי שאלות מתוך NeXT-QA, ActivityNetQA ו־PerceptionTest, לצד הפניות לקבצי הווידאו וההוראות של LLaVA-Hound שכולל עוד 240,000 שאלות פתוחות.

מתאים ל

  • אימון מודלי וידאו

    כוונון עדין של מודלים מולטימודליים למענה על שאלות מורכבות על סמך רצף תמונות לאורך זמן.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של כתוביות ושאלות שנוצרו על ידי מודלי שפה על איכות הבנת הווידאו.

  • הערכת ביצועי מודלים

    בחינת יכולות של רשתות ראייה ממוחשבת במבחנים אמריקאיים מול שאלות פתוחות על קטעים קצרים.

איפה זה נופל

הטקסטים נוצרו על ידי GPT-4o, מה שאומר שהם סוחבים איתם את ההזיות וההטיות של מודל המקור. השפות הנתמכות הן אנגלית וסינית בלבד, ואין כאן עברית בכלל. בנוסף, המקורות של הסרטונים הם תכנים קיימים מיוטיוב ומאגרים אקדמיים, כך שהאיכות והכיסוי מוגבלים לסגנון הסרטונים שנאסף שם, ללא נתונים על מגוון התחומים בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. למרות אזכור רישיון Apache 2.0, החוקרים הגבירו את התנאים והגבילו את המאגר למחקר וחינוך בלבד. בנוסף, הנתונים הופקו באמצעות מודלים של OpenAI, מה שמחיל מגבלות שימוש מסחריות נוספות.

האם יש במאגר תמיכה בשפה העברית?

אין שום תמיכה בעברית. כל קבצי הטקסט, השאלות והתשובות שמלווים את הסרטונים כתובים באנגלית ובחלקם בסינית.

איך המידע הזה נאסף ונבנה?

החוקרים אספו סרטונים מיוטיוב וממאגרים קיימים, והריצו עליהם את GPT-4o עם פרומפטים ייעודיים. התהליך ייצר באופן אוטומטי תיאורי סצנות, שאלות פתוחות ושאלות רב ברירה שמבוססות על המתרחש בווידאו.

איך טוענים את הנתונים לעבודה מקומית?

מורידים את קובצי ה־tar.gz שמכילים את קטעי הווידאו ופותחים אותם בתיקיות ייעודיות לפי המקטע הרצוי. את השאלות והתשובות טוענים ישירות מתוך קבצי ה־json המצורפים לכל מקור.

איך טוענים

הנתונים מחולקים ל־302 קבצים שדורשים פריקה ידנית ולא טעינה אוטומטית פשוטה בשורה אחת. הסרטונים ארוזים בארכיוני tar.gz ממוספרים, ולצדם קבצי json שמכילים את התמלולים, השאלות הפתוחות והשאלות האמריקאיות. אין צורך באישור גישה מיוחד, אבל צריך לוודא שיש לכם מספיק שטח אחסון ותעבורה פנויה כדי להתמודד עם הורדה של מאות קובצי וידאו דחוסים.

from datasets import load_dataset

ds = load_dataset("lmms-lab/LLaVA-Video-178K")

הרישיון

החוקרים מציינים Apache 2.0 בטקסט, אבל במקביל כותבים במפורש שהשימוש מותר למטרות מחקר אקדמי וחינוך בלבד. מעבר לזה, המידע מבוסס על פלטים של OpenAI ולכן כפוף לתנאי השימוש שלהם, שאוסרים על אימון מודלים מתחרים. בפועל, אל תבנו על זה מוצר מסחרי, כי הבלבול בין סוגי הרישיונות יחשוף אתכם לתביעות.

הרישיון המלא ב־Hugging Face ↗