GPT
T

train_video_and_instruction

קוד פתוח

ShareGPTVideoapache-2.02024-03-13

  • GPT-4V
  • video

מאגר נתונים מקיף שמחבר פריימים מתוך סרטונים עם שאלות, תשובות ותיוגי העדפה לאימון מודלי וידאו רב-מודאליים. מי שבונה מודל להבנת וידאו יקבל כאן דאטה מוכן לשלבי האימון המקדים, כוונון ההוראות ויישור העדפות.

  • 2,777הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל מידע שנבנה על בסיס שלושה מקורות וידאו מוכרים: ActivityNet, Vidal ו־WebVid, בהיקף כולל של 900 אלף סרטונים. המידע מחולק לפי שלבי עבודה. לחלק של אימון מקדים יש 900 אלף תיאורי וידאו מפורטים יחד עם פריימים תואמים, שמתוכם 450 אלף מגיעים מ־Vidal, עוד 400 אלף מ־WebVid ו־50 אלף מ־ActivityNet.

לשלבי הכוונון וההתאמה יש תת-קבוצה של 300 אלף סרטונים. עבור תת-קבוצה זו נוצרו 900 אלף צמדי שאלות ותשובות, שלושה לכל סרטון, שנוצרו בעזרת ChatGPT, כאשר היוצרים השתמשו בפועל ב־240 אלף מתוכם לכוונון עדין. בנוסף, המאגר מספק 17 אלף דוגמאות העדפה עבור יישור באמצעות DPO, שמכילות את שאלת המשתמש, תשובה שנבחרה, תשובה שנדחתה וציונים שניתנו להן.

מתאים ל

  • אימון מקדים למודלי וידאו

    שימוש ב־900 אלף תיאורי הווידאו והפריימים ללימוד חיבור בסיסי בין תמונה לטקסט.

  • כוונון הוראות מענה לשאלות

    אימון מודל לענות על שאלות חופשיות לגבי תוכן ויזואלי באמצעות 900 אלף צמדי QA.

  • יישור העדפות עם DPO

    שיפור איכות התשובות והפחתת הזיות במודלי וידאו על בסיס 17 אלף זוגות בחירה ודחייה.

איפה זה נופל

כל הטקסטים וההוראות במאגר קיימים באנגלית בלבד. אם המטרה היא מערכת שמבינה שפה מקומית, תצטרכו לתרגם את הנתונים או לאמן שכבות שפה בנפרד. בנוסף, השאלות והתשובות מיוצרות באופן סינתטי על ידי מודל שפה של OpenAI ולא נבדקו ידנית אחת לאחת, מה שעלול להכניס הזיות או תיאורים שגויים לגבי מה שבאמת קורה בווידאו. הדאטהסט גם נשען על קבוצות נתונים חיצוניות ותיקות יותר, ולכן יש לקחת בחשבון הטיות תוכן ואיכות וידאו משתנה שמגיעות מהמקורות האלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון המוצהר בדף המאגר הוא apache-2.0, שמאפשר שימוש מסחרי ללא תמלוגים. יחד עם זאת, הטקסטים נוצרו באמצעות ChatGPT והסרטונים נשענים על מקורות כמו WebVid ו־ActivityNet, כך שיש לוודא שתנאי השימוש של המקורות הללו מתאימים לדרישות המשפטיות שלכם.

האם הנתונים כוללים עברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל השיחות, השאלות ותיוגי ההעדפה כתובים באנגלית. כדי לעבוד בעברית תצטרכו לבצע תרגום מכונה של הנתונים או להשתמש בו לאימון מקדים ולכוונן אחר כך על דאטה מקומי.

איך נאספו השאלות והתשובות למאגר?

היוצרים לקחו פריימים מתוך הסרטונים והשתמשו במודל שפה של OpenAI כדי להפיק באופן אוטומטי שלושה צמדי שאלות ותשובות עבור כל סרטון בחלק של ה־300k. דאטת ה־DPO נוצרה גם היא בהליך שכלל ציון תשובות נבחרות ונדחות על ידי מודל.

האם צריך להוריד את כל 900 אלף הסרטונים?

לא בהכרח. אם המטרה שלכם היא רק כוונון עדין למשימות של שאלות ותשובות או יישור העדפות, היוצרים מציינים שאפשר להסתפק בהורדת החלק של ה־300k בלבד, שבו מרוכזים קובצי ההוראות הרלוונטיים.

איך טוענים

הקבצים שמורים במאגר Hugging Face ומחולקים לארכיוני tar.gz דחוסים לפי מקטעים, כמו train_300k, לצד קובצי טקסט בפורמט JSONL להוראות ולשאלות. אין צורך באישור גישה מיוחד כדי להוריד, אך מדובר ב־57 קבצים המכילים מאות אלפי פריימים, ולכן נדרש נפח אחסון מקומי משמעותי ותהליך חילוץ מסודר. היוצרים מספקים סקריפטים ייעודיים במאגר הגיטהאב של פרויקט LLaVA-Hound-DPO להגדרת הסביבה והורדת הדאטה בצורה אוטומטית.

from datasets import load_dataset

ds = load_dataset("ShareGPTVideo/train_video_and_instruction")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף מודלים שאימנתם תחת אותו רישיון בדיוק. עם זאת, יש לזכור שהנתונים מבוססים על סרטונים ממקורות קיימים וטקסט שנוצר ב־ChatGPT, ולכן כדאי לבדוק את תנאי השימוש של אותם מקורות לפני שילוב ישיר במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗