GPT
M

M4-Instruct-Data

קוד פתוח

lmms-labcc-by-4.02024-06-26

המאגר מרכז נתונים לאימון מודלי ראייה שפה על רצפים של כמה תמונות ווידאו. הוא נבנה במיוחד כדי ללמד מודלים להבין הקשר ויזואלי מתמשך ולא תמונה בודדת ומנותקת.

  • 1,099הורדות בחודש
  • 79לייקים

מה זה

המאגר מיועד לאימון מודלים מולטימודליים, כמו LLaVA-NeXT-Interleave, על משימות שדורשות הבנה של מספר תמונות משולבות בטקסט. הדאטה כולל דוגמאות של ריבוי תמונות, פריימים של וידאו, וזוויות שונות של אובייקטים בתלת ממד. החומרים נאספו באפריל 2024 משילוב של מאגרי נתונים ציבוריים מוכרים ודוגמאות שנוצרו ישירות דרך ה־API של GPT-4V, בהיקף כולל של בין מאה אלף למיליון רשומות.

המבנה של המאגר מחולק לקבצי אנוטציות בפורמט JSON ולעשרות קבצי ארכיון מכווצים שמכילים את המדיה הוויזואלית. בין הקבצים אפשר למצוא נתונים ממאגרים כמו DocVQA למסמכים, ALFRED למשימות סביבה, CLEVR-Change לזיהוי שינויים, לצד קבצים כמו HQ-Edit ו־COMICS Dialogue. חשוב לדעת שחלק מנתוני הווידאו אינם כלולים ישירות כאן, והיוצרים מציינים שיש להוריד אותם עצמאית ממאגר חיצוני בשם LLaVA-Hound כדי להגיע לסט המלא.

מתאים ל

  • אימון מודלי שפה על רצף תמונות

    אימון מודלים מולטימודליים על רצפי תמונות כדי להבין שינויים בזמן וקשרים בין זוויות שונות.

  • מענה על שאלות מתוך וידאו

    שימוש בפריימים עוקבים ובקובץ הווידאו המצורף כדי לבנות יכולת מענה על שאלות מתוך קטעי צילום.

  • שחזור של LLaVA-NeXT-Interleave

    שחזור מדויק של תהליך האימון של המודל לפי המתכון והנתונים שפורסמו על ידי צוות המחקר.

איפה זה נופל

כל הטקסטים וההוראות בדאטהסט מופיעים באנגלית בלבד, ואין בו שום ייצוג לעברית. בנוסף, המאגר לא עצמאי לחלוטין. כדי לאמן מודל מלא נדרשת הורדה של מאגרי וידאו ותמונות חיצוניים שאינם ארוזים כאן, מה שמסבך את תהליך ההכנה. חלק מהנתונים יוצרו על ידי GPT-4V, מה שמכניס הטיות והזיות סינתטיות של המודל שיצר אותם, ודורש בדיקה מדגמית של איכות התיוגים לפני שרצים לאמן על זה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

המאגר עצמו פורסם תחת רישיון CC-BY-4.0 שמתיר שימוש מסחרי עם ייחוס. עם זאת, היוצרים דורשים ציות לתנאי השימוש של OpenAI כיוון שהופק דאטה באמצעות GPT-4V. תנאים אלה מגבילים אימון של מודלים מתחרים, ולכן שימוש מסחרי דורש זהירות ובדיקה משפטית.

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים, השאלות והתשובות בדאטהסט מוגדרים באנגלית בלבד. אם המטרה היא להכשיר מודל לשוק הישראלי, תצטרכו לתרגם את החומר או לאמן אותו על דאטה רב-לשוני נוסף.

האם הדאטהסט כולל את כל הקבצים הנדרשים לאימון?

לא באופן מלא. המאגר כולל את נתוני ריבוי התמונות והאנוטציות, אך כדי להשתמש בנתוני הווידאו המלאים צריך להוריד קבצים נוספים ממאגר LLaVA-Hound. בנוסף, לשחזור מלא של מודל LLaVA נדרשת דגימה נוספת ממאגר LLaVA-1.5.

איך נאסף המידע בדאטהסט?

הנתונים נאספו באפריל 2024 משני מקורות עיקריים. חלקם לוקט ממאגרי מחקר פתוחים ומוכרים בתחום הראייה הממוחשבת, וחלקם נוצר באופן סינתטי באמצעות שימוש ב־API של GPT-4V.

איך טוענים

במאגר יש 41 קבצים, והוא פתוח להורדה ישירה ללא צורך באישור גישה. הטעינה נעשית דרך קבצי האנוטציות m4_instruct_annotations.json ו־m4_instruct_video.json, לצד פריקה של קבצי ה־ZIP המכילים את התמונות. שימו לב שבחלק מהקבצים, כמו dreamsim_split, המידע מפוצל ודורש איחוד ידני בפקודת zip ייעודית לפני החילוץ. אם תרצו לשחזר במדויק את אימון LLaVA-NeXT-Interleave, תצטרכו להשלים נתוני תמונה בודדת ממקור חיצוני ולדגום 307 אלף דוגמאות מאימון של LLaVA-1.5.

from datasets import load_dataset

ds = load_dataset("lmms-lab/M4-Instruct-Data")

הרישיון

הרישיון הרשמי הוא CC-BY-4.0, שמאפשר שימוש, שינוי והפצה כולל שימוש מסחרי תחת מתן קרדיט מתאים. עם זאת, היוצרים מדגישים שהשימוש חייב לציית לתנאי השירות של OpenAI בגלל שחלק מהנתונים הופקו באמצעות ה־API של GPT-4V. התנאים האלה אוסרים בדרך כלל על אימון מודלים שמתחרים ישירות במוצרים של החברה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗