GPT
A

ASID-1M

קוד פתוח

AudioVisual-Captioncc-by-2.02026-02-10

  • caption
  • audiovisual
  • instruction-tuning
  • attribute-structured
  • quality-verified

מאגר לאימון מודלי וידאו מרובי אופנויות שמפרק כתוביות לשמונה מאפיינים מוגדרים. הוא מציע סרטונים עם תמלול, תנועות מצלמה, זיהוי אובייקטים ורגשות במקום טקסט כללי יחיד.

  • 789הורדות בחודש
  • 85לייקים

מה זה

המאגר כולל 361,531 שורות מאומתות בקובצי JSONL לצד קובצי וידאו מקוריים. הנתונים מחולקים לארבעה מקורות עיקריים לפי אורך הסרטון ומקורו: סרטוני יוטיוב קצרים של עד חצי דקה, סרטונים של חצי דקה עד דקה, סרטונים באורך דקה עד שתי דקות, ותת קבוצה המבוססת על FineVideo.

כל רשומה בנויה בפורמט שיחה המיועד לכוונון מודלים, ומכילה נתיב לקובץ הווידאו, הודעות מערכת, הוראות משתמש ותשובות. ההוראות מתמקדות בשמונה מאפיינים: סביבה, דמויות, חפצים, פעולות, עלילה מעוגנת בזמן, דיבור מתוזמן, תנועות מצלמה ורגשות. התיוגים מסודרים בשתי תצורות אימון, תצורה ממוקדת מאפיין בודד ותצורה הכוללת את כל המאפיינים יחד. תהליך הסינון כלל יצירה ראשונית, איחוד מקורות, אימות מאפיינים ותיקון שגיאות חסר ועקביות בזמן.

מתאים ל

  • אימון הבנת וידאו מרובת אופנויות

    כוונון מודלים גדולים המשלבים תמונה, קול וזמן, ליצירת הבנה מעמיקה של סצנות וידאו מורכבות.

  • הפקת כתוביות לפי מאפיין

    אימון מערכות לתמלול ממוקד שמגיבות להנחיות ספציפיות, כמו פירוט רגשות בלבד או תיאור תנועות מצלמה.

  • עיגון זמני של דיבור ופעולות

    חיבור נקודות זמן מדויקות בסרטון לאירועים עלילתיים או לטקסט מדובר שעבר תמלול.

איפה זה נופל

הנתונים כולם באנגלית, מה שהופך את המאגר ללא רלוונטי לאימון על שפה אחרת ללא תרגום מקדים. למרות תהליכי האימות והסינון, היוצרים מצהירים במפורש שעדיין קיים רעש מסוים בנתונים ושנדרש סינון ייעודי בהתאם למשימה. בנוסף, חלוקת הנתונים לקובצי ארכיון גדולים מחייבת כוח מחשוב ונפח אחסון מקומי משמעותי לחילוץ הסרטונים, או הטמעה של טעינה מורכבת מתוך ארכיונים בזמן אימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים המיועדים למוצרים סגורים. הדרישה היחידה היא מתן ייחוס מתאים למפרסמים.

האם המאגר כולל עברית?

לא. המאגר מוגדר ומתוייג באנגלית בלבד. כדי לאמן מודל להוראות בעברית תצטרכו לתרגם את הטקסטים של ההוראות והתשובות באופן עצמאי.

איך הסרטונים והתיוגים נאספו?

הסרטונים לוקטו מיוטיוב וממאגר FineVideo וחולקו לפי מקטעי זמן. התיוגים נוצרו בתהליך רב שלבי שכלל הרכבה ממספר מקורות, אימות פרטני של שמונה מאפיינים ובדיקת עקביות זמנית.

במה הוא שונה ממאגרי כתוביות וידאו רגילים?

במקום לספק תיאור טקסטואלי יחיד וכללי לכל קליפ, הוא מפרק את הפיקוח לשמונה היבטים מובחנים הכוללים סאונד, מצלמה, רגש ורצף זמני. זה מאפשר לאמן מודלים לענות על שאלות ממוקדות ולא רק לתאר את התמונה הכללית.

איך טוענים

טעינת ההוראות מתבצעת ישירות דרך ספריית datasets באמצעות הפניה לקובצי ה־JSONL הרלוונטיים בתוך תיקיית annotations. הורדת קובצי הווידאו עצמם דורשת משיכה מלאה של המאגר באמצעות snapshot_download, מכיוון שהם שמורים ב־111 קובצי tar.gz דחוסים. אין צורך באישור גישה מוקדם כדי להוריד. השדות המרכזיים בכל רשומה הם videos שמכיל את נתיב הקובץ, messages שמחזיק את רצף השיחה, ו־meta שמפרט את מזהה הווידאו ואת רשימת המאפיינים המפוקחים.

from datasets import load_dataset

ds = load_dataset("AudioVisual-Caption/ASID-1M")

הרישיון

המאגר מופץ תחת רישיון cc-by-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של תוצרים או מודלים מאומנים תחת אותו רישיון. החובה המרכזית היא מתן קרדיט וייחוס ברור ליוצרים המקוריים.

הרישיון המלא ב־Hugging Face ↗