GPT
M

MMMU

קוד פתוח

MMMUapache-2.02023-11-27

  • biology
  • medical
  • finance
  • chemistry
  • music

שאלות רב ברירה ומענה חופשי ברמה אקדמית שמשלבות עד שבע תמונות לשאלה. מי שבוחר בו רוצה לבחון יכולת הסקת מסקנות מולטימודלית מורכבת בתחומים מקצועיים מוגדרים.

  • 76,891הורדות בחודש
  • 333לייקים

מה זה

המאגר מחולק לפי מקצועות שונים כמו הנדסה, רפואה, אמנות, מדעים מדויקים וכלכלה. בכל תחום כזה יש סט נתונים נפרד שמכיל שאלות, אפשרויות בחירה, שדה הסבר, תשובה נכונה ורמת קושי. הייחוד כאן הוא העומס הוויזואלי, כאשר כל רשומה כוללת שדות ייעודיים לעד שבע תמונות שונות יחד עם תיוג סוג התמונה.

החלוקה הפנימית בכל מקצוע עוקבת אחרי מבנה קבוע של שלושה חלקים. יש חלק פיתוח קטן מאוד שמכיל חמש דוגמאות בלבד, חלק אימות עם שלושים דוגמאות, וחלק מבחן שמכיל כמה מאות שאלות ומהווה את עיקר הנפח. המידע בכרטיס לא מפרט מהיכן בדיוק נאספו השאלות במקור או באיזה אופן סיננו אותן.

מתאים ל

  • הערכת מודלי ראייה שפה

    בדיקת יכולת המודל לנתח תרשימים, גרפים ותמונות מקצועיות לצד טקסט.

  • בנצ'מרק למבחני מומחה

    מדידת דיוק התשובות בשאלות רב ברירה מורכבות ברמה אקדמית.

  • אימון משלים ליכולת מולטימודלית

    כוונון עדין של מודלים על שאלות שדורשות שילוב מידע מכמה תמונות במקביל.

איפה זה נופל

התוכן כולו באנגלית בלבד ואין בו שום ייצוג לעברית. בנוסף, המאגר פורסם בנובמבר 2023, כך שהוא לא משקף שינויים מקצועיים או גילויים מדעיים מאוחרים יותר. כרטיס הדאטהסט חסר כל מידע על אופן האיסוף, שיטות הסינון או הטיות אפשריות של כותבי השאלות, ולכן חובה לבדוק ידנית את איכות הדוגמאות וההסברים לפני שמבססים עליהם החלטות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא Apache 2.0, שמתיר שימוש מסחרי מלא כולל אימון מודלים. יש להקפיד על מתן ייחוס כמקובל ברישיון.

כמה שוקל הדאטהסט?

המשקל משתנה מאוד לפי התחום שמורידים. תחומים עם מעט תמונות שוקלים עשרות מגה בייטים בודדים, בעוד שתחומים עתירי גרפיקה כמו חקלאות מגיעים ליותר משני ג'יגה בייט.

האם הנתונים כוללים עברית?

לא. המאגר מוגדר וקיים בשפה האנגלית בלבד.

מהיכן נאספו השאלות והתמונות?

כרטיס הדאטהסט לא מפרט את מקורות המידע או את תהליך הסינון. ידוע רק שהנתונים מאורגנים לפי מקצועות אקדמיים ומכילים מגוון שדות תמונה והסברים.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face תוך ציון שם התחום הספציפי שרוצים לבדוק, למשל קונפיגורציה של ביולוגיה או הנהלת חשבונות. אין צורך לבקש אישור גישה מראש כדי להוריד. הקבצים שמורים בפורמט Parquet, אך בגלל התמונות המשובצות ברשומות, הורדה של תחומים מסוימים כמו חקלאות מגיעה לנפח של יותר משני ג'יגה בייט.

from datasets import load_dataset

ds = load_dataset("MMMU/MMMU")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר אימון מודלים, ביצוע שינויים והפצה של תוצרים נגזרים. הדרישה העיקרית היא מתן קרדיט מתאים וצירוף עותק של הרישיון והודעות זכויות היוצרים בכל הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗