GPT
S

ShareGPT4Video

קוד פתוח

ShareGPT4Videocc-by-nc-4.02024-05-22

מאגר כתוביות ותיאורים לווידאו שנוצרו באמצעות מודלי שפה, במטרה לשפר דיוק של מודלי שפה ווידאו. מתאים למי שבונה מודלים שמנתחים וידאו או מייצרים וידאו מטקסט.

  • 9,261הורדות בחודש
  • 204לייקים

מה זה

המאגר כולל מיליוני תיאורים מפורטים לווידאו ברמות שונות. גרעין של 40 אלף רשומות נכתב ישירות על ידי GPT4-Vision, ועל בסיסו אומן מודל ייעודי בשם ShareCaptioner-Video שיצר מעל 4.8 מיליון תיאורים נוספים מסרטונים שמקורם בפלטפורמות Mixkit, Pexels ו־Pixabay.

הקבצים מחולקים לפי מטרות האימון. ישנם קובצי JSONL ו־JSON ממוקדים למשימות שונות, כולל קובץ של 181 אלף דוגמאות שמיועד לשלב האימון המונחה במודלי וידאו, וקובץ משולב עם LLaVA שבו הוחלפו 28 אלף תיאורים מקוריים בתיאורים האיכותיים יותר של המאגר כדי לבחון שיפור ביצועים במודלים קיימים.

מתאים ל

  • אימון מודלי וידאו-שפה

    שיפור היכולת של מודלים מולטימודליים לענות על שאלות ולהבין תנועה ברצפי וידאו.

  • אימון מודלי יצירת וידאו

    שימוש בתיאורים מפורטים של 4.8 מיליון סרטונים לשיפור מודלים המייצרים וידאו מטקסט.

  • כוונון עדין למודלי שיחה

    שימוש בקובץ ה־181K המותאם מראש לשלב הכוונון המונחה במודלים ויזואליים.

איפה זה נופל

הטקסטים כולם באנגלית, כך שאין כאן שום מידע או תמיכה בעברית. הנתונים מבוססים על סרטונים חינמיים מאתרי מאגרי מדיה כמו Pexels ו־Pixabay, מה שמייצר הטיה ברורה לסרטונים מבוימים, קצרים ואסתטיים, ופחות לתנועה טבעית, מצלמות אבטחה או שיחות יומיומיות. בנוסף, רוב התיאורים נוצרו על ידי מודל שפה ולא על ידי עין אנושית, מה שאומר שהזיות וטעויות זיהוי ויזואליות קיימות בטקסט ודורשות סינון אם אתם מכוונים למודל קריטי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא לא מסחרי באופן מפורש, וכולל גם כפיפות למדיניות של OpenAI. כל מודל שתאמנו על הדאטהסט הזה מוגבל למחקר בלבד.

האם הדאטהסט כולל את קובצי הווידאו עצמם?

לא. המאגר מספק את התיאורים, קובצי מטא-דאטה וסקריפטים להורדה. את קובצי הווידאו תצטרכו להוריד בעצמכם מהאתרים החיצוניים באמצעות הסקריפטים המצורפים.

האם יש במאגר נתונים בעברית?

המאגר כולו באנגלית בלבד. כל התיאורים והשאלות נוצרו באנגלית, ואינם מכילים שפות אחרות.

איך נאספו ונוצרו התיאורים?

חלק קטן של 40 אלף תיאורים הופק באמצעות GPT4-Vision על סרטונים. המפתחים אימנו מודל משלהם על הדוגמאות האלה, והוא ייצר את שאר 4.8 מיליון התיאורים מסרטונים שנאספו מ־Mixkit, Pexels ו־Pixabay.

איך טוענים

לא מורידים כאן קובץ וידאו ענק בבת אחת, אלא קובצי מטא-דאטה בפורמט JSON ו־JSONL יחד עם סקריפטים של פייתון להורדת הווידאו עצמו. המאגר מכיל 101 קבצים, וכולל סקריפטים ייעודיים כמו download_dataset.py ו־download_panda_video.py שמורידים את הסרטונים בפועל לפי קובצי CSV. אין צורך באישור גישה ידני, פשוט מושכים את הקבצים. קחו בחשבון שהורדת הווידאו עצמו מהרשת תיקח זמן ותדרוש נפח אחסון משמעותי.

from datasets import load_dataset

ds = load_dataset("ShareGPT4Video/ShareGPT4Video")

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי בלבד ומחייב מתן קרדיט. אי אפשר להשתמש בנתונים האלה כדי לבנות מודל מסחרי או לשלב אותם במוצר שמייצר הכנסה. בנוסף, מאחר שהטקסטים נוצרו באמצעות GPT-4V, הם כפופים למדיניות השימוש של OpenAI, שאוסרת על שימוש בפלטים שלה לאימון מודלים שמתחרים בה ישירות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗