GPT
M

MMEB-train

קוד פתוח

TIGER-Labapache-2.02024-10-08

  • embedding

מאגר אימון מקיף למודלי אמבדינג מולטימודליים, שמשלב תמונה וטקסט כדי ללמד מודלים לייצר וקטורים משותפים. הוא מתאים למי שבונה חיפוש או אחזור חכם שמשלב כמה סוגי מדיה ביחד.

  • 4,980הורדות בחודש
  • 18לייקים

מה זה

המאגר כולל בין מיליון לעשרה מיליון רשומות, ומבוסס על 20 דאטהסטים ציבוריים שונים שנבחרו מתוך בנצ'מרק רחב יותר של 36 מאגרים. בין המקורות תמצאו דאטהסטים מוכרים כמו ChartQA, CIRR ו־A-OKVQA, שכוללים משימות שונות של שאלות ותשובות על תמונות, אחזור תמונות לפי שינוי טקסטואלי וניתוח תרשימים.

כל תת-מאגר מחולק לשתי גרסאות עיקריות. הראשונה שומרת על ההוראות המקוריות של הדאטהסט כדי לאפשר שחזור תוצאות המחקר של VLM2Vec, והשנייה מכילה ניסוחים מגוונים להוראות כדי לשפר את עמידות המודל לפקודות חדשות. הרשומות עצמן בנויות משאילתה ומטרות, כאשר כל צד יכול להכיל טקסט, תמונה או שילוב ביניהם.

מתאים ל

  • אימון מודלי אחזור מולטימודלי

    לימוד מודלים להפיק וקטורים מתמונות ומטקסט לצורך מנועי חיפוש היברידיים.

  • הכללת הוראות במודלי שפה

    שימוש בגרסת ההוראות המגוונות כדי לחזק מודלים מול ניסוחים חדשים.

  • שחזור מחקר VLM2Vec

    אימון מקביל על גרסת ההוראות המקוריות לבדיקת תוצאות המאמר האקדמי.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין כאן תמיכה בעברית או בשפות נוספות. המאגר הוא איחוד של מקורות שונים, כך שהאיכות וההטיות תלויות בכל דאטהסט מקור בנפרד. בנוסף, מדובר רק בחלק האימון שמכסה 20 משימות מתוך 36 המשימות בבנצ'מרק השלם, כך שלבדיקת ביצועים אמיתית תצטרכו להוריד בנפרד את מאגר ההערכה. אם המוצר שלכם צריך לעבוד עם טקסט מקומי או תמונות עם כיתוב בעברית, המאגר הזה פשוט לא יספיק לכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מוגדר ברישיון apache-2.0 שמאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולהשתמש בתוצרים בתוך מוצרים מסחריים. התנאי העיקרי הוא מתן קרדיט ושמירה על תנאי הרישיון המקורי בקבצים הרלוונטיים.

האם המאגר כולל דוגמאות בעברית?

לא, הנתונים מתועדים באנגלית בלבד. כל הטקסטים והשאילתות במאגרי המקור מבוססים על השפה האנגלית. אם תרצו תמיכה בעברית, תצטרכו לאסוף או לתרגם נתונים באופן עצמאי.

מה ההבדל בין קובצי original לקובצי diverse instruction?

גרסת original שומרת על הניסוח המקורי של המשימות מתוך הדאטהסטים שנאספו, ונועדה בעיקר לשחזור מדויק של תוצאות המאמר. לעומת זאת, diverse instruction מכילה ניסוחים חלופיים להוראות המשימה. המטרה שם היא למנוע התאמת יתר ולאמן מודל שיודע להתמודד עם הנחיות שלא פגש קודם.

מאיפה הגיעו הנתונים שנמצאים במאגר?

יוצרי המאגר בחרו 20 דאטהסטים ציבוריים קיימים בתחום הראייה והשפה, כמו ChartQA ו־CIRR, ואיחדו אותם למבנה אחיד. הנתונים עצמם סודרו מחדש בפורמט של שאילתה ומטרות התאמה עבור משימות אמבדינג. לא מדובר באיסוף נתונים חדש מהרשת, אלא בארגון מחדש של מקורות מחקריים קיימים.

איך טוענים

הנתונים מחולקים ל־84 קובצי Parquet שונים לפי שמות הדאטהסטים והגרסאות, ללא צורך באישור גישה מיוחד. אפשר לטעון אותו ישירות דרך ספריית datasets של Hugging Face לפי הנתיב המבוקש. לפני שמתחילים כדאי לקחת בחשבון את נפח האחסון, כי עבודה עם מיליוני דוגמאות מולטימודליות דורשת רוחב פס רציני ומקום פנוי בדיסק. מומלץ לבחור מראש רק את תתי-התיקיות הרלוונטיות, כמו diverse_instruction למשל, במקום להוריד את כל המאגר בבת אחת.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/MMEB-train")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי והפצה של הנתונים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון, ומותר לאמן עליו מודלים מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗