GPT
V

VideoChat3-LV116k

קוד פתוח

MCG-NJUapache-2.02026-07-05

  • video
  • long video

מאגר הוראות לסרטונים ארוכים שנועד לאמן מודלים על הקשרים מורכבים בזמן. הוא כולל תיאורים, שאלות ותשובות ועיגון זמני שנבנו מתכנים מרובי קטעים.

  • 32,309הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל קובצי תיוג בפורמט JSONL וסרטונים שנאספו מכמה מקורות שונים. הצוות סינן סרטונים ארוכים לפי איכות ויזואלית, תוכן סמנטי ועקביות בזמן, חילק אותם למקטעים קצרים, תייג כל מקטע בנפרד ואימת את המידע. על בסיס הפירוק הזה נוצרו כתוביות לסרטונים שלמים, צמדי שאלות ותשובות ונתוני עיגון זמני שמקשרים טקסט לנקודות בציר הזמן.

המקורות מתחלקים לארבעה חלקים עיקריים. חלק אחד מבוסס על CinePile שמתמקד בסיכום סרטים ושאלות עליהם. חלק שני נשען על LongVideoDB ומיועד לקווי זמן, עיגון זמני ותשובות. שני החלקים הנוספים, SciVideo_Long ו־SciVideo_Short, מורכבים מסרטוני מדע שנאספו באופן עצמאי על ידי יוצרי המאגר.

מתאים ל

  • אימון הבנת וידאו ארוך

    כוונון עדין של מודלי שפה ויזואליים למעקב אחרי עלילה ופרטים שנפרסים על פני דקות רבות.

  • עיגון זמני של אירועים

    אימון מודלים לאיתור זמני התחלה וסיום של אירועים מוגדרים מתוך רצף הווידאו לפי פקודת טקסט.

  • סיכום סרטים ותוכן מדעי

    פיתוח יכולת מענה על שאלות וסיכום תכנים מורכבים מסרטי קולנוע וסרטוני מדע והסברה.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום ייצוג לעברית. כל התיוגים נשענים על תהליך סינתטי של חיבור מקטעים, כך שטעויות תיוג במקטע בודד יכולות להשפיע על שאלות ותשובות של הסרטון המלא. בנוסף, חלוקת הסרטונים בין ארכיונים פנימיים למקורות חיצוניים מחייבת בדיקה זהירה של התאמת הנתיבים לפני שמתחילים אימון יקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. המאגר מוגדר תחת רישיון Apache 2.0 שאינו מגביל שימוש מסחרי. עליכם להקפיד על מתן קרדיט וייחוס מתאים לקבוצת המחקר ולמאגרי המקור.

האם המאגר כולל עברית?

לא. כלל התיוגים, השאלות וההוראות הטקסטואליות נוצרו באנגלית בלבד. אם המוצר שלכם פונה לשוק המקומי, תצטרכו לתרגם את הנתונים או להוסיף דאטה ייעודי בעברית.

האם כל הסרטונים כלולים בהורדה ישירה מהמאגר?

חלק מהסרטונים, כמו אלה של SciVideo ומבחר מ־CinePile ו־LongVideoDB, מועלים כארכיוני tar בתוך המאגר. עבור חלקים אחרים יש לפנות לנתיבי המקור המקוריים לפי המיפוי בקובץ lv116k.json.

איך נוצרו התיוגים במאגר?

החוקרים סיננו סרטונים ארוכים, חילקו אותם למקטעים זמניים קצרים ותיקפו את התיאורים של כל מקטע. לאחר מכן המערכת חיברה את המקטעים לכדי תיאור מלא, שאלות ותשובות ונקודות עיגון זמני.

איך טוענים

את ההוראות והתיוגים תמצאו בקובצי JSONL לצד קובץ המיפוי lv116k.json, שמקשר בין התיוג לסרטון המתאים. המאגר מכיל מעל תשעת אלפים קבצים, כולל ארכיוני tar של סרטונים כמו אלה של CinePile וסרטי המדע שמועלים ישירות לכאן. אין צורך באישור גישה מיוחד כדי להוריד, אבל בגלל כמות המדיה ופיצול הקבצים תצטרכו להכין מראש סקריפטים לחילוץ וחיבור מקומי של הווידאו מול התיוגים.

from datasets import load_dataset

ds = load_dataset("MCG-NJU/VideoChat3-LV116k")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים למטרות מחקר או יישומים מסחריים בלי לחייב פתיחה של הקוד שלכם. חובה לשמור על הודעות זכויות היוצרים והייחוס המקוריות, והיוצרים מבקשים לצטט גם את עבודת VideoChat3 וגם את מאגרי המקור ששימשו לבנייתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗