GPT
M

MMMU_Pro

קוד פתוח

MMMUapache-2.02024-08-27

  • chemistry
  • biology
  • music
  • art
  • medical

מבחן מאתגר להערכת מודלים רב-מודאליים על שאלות אקדמיות עם תמונות. הוא נועד למנוע ניחושים על ידי הגדלת כמות המסיחים ובדיקת תמונות המכילות טקסט משולב.

  • 22,325הורדות בחודש
  • 66לייקים

מה זה

המאגר מבוסס על מבחן MMMU המקורי, ועבר סינון קפדני שבו ארבעה מודלי שפה חזקים ניסו לפתור שאלות ללא התמונות. שאלות שנפתרו באופן עקבי ללא צורך בתמונה הוצאו מהמאגר, כדי לוודא שרק שאלות הדורשות הבנה חזותית אמיתית יישארו בפנים.

התוכן מאורגן בתצורות שונות לבדיקת עמידות המודל. גרסת standard מציעה שאלות טקסט רב-ברירתיות בצירוף תמונות נפרדות, כאשר במקום ארבע אפשרויות נפוצות ניתנות עשר אפשרויות בחירה כדי להקשות על ניחוש. תצורת vision מאתגרת יותר, ובה השאלות והאפשרויות מוטמעות כולן כצילומי מסך או תמונות בסביבה מדומה עם גופנים ורקעים משתנים, ללא קלט טקסטואלי מופרד.

מתאים ל

  • הערכת ביצועים רב-מודאליים

    בדיקת יכולת המודל לשלב מידע חזותי וטקסטואלי ברמה אקדמית גבוהה.

  • מבחן עיוור ללא טקסט

    הערכת יכולות ראייה ממוחשבת כאשר השאלות והתשובות מופיעות בתוך תמונה בלבד.

  • מזעור ניחושים בהסקה

    מדידת דיוק המודל מול עשר אפשרויות שונות כדי לבודד ידע מהסתברות אקראית.

איפה זה נופל

כל השאלות והתמונות במאגר הן באנגלית בלבד, ואין כאן נתונים בעברית. המאגר מיועד לבחינה והערכה ולא לאימון רחב של מודלים. כמו כן, מדובר בשאלות ממבחנים אקדמיים, שלא בהכרח מייצגות אינטראקציות יומיומיות בעולם האמיתי. יומן העדכונים של הפרויקט מעיד על מספר תיקונים שנעשו בתוויות התשובות הנכונות ובשגיאות בהתאמת האפשרויות, כך שעדיין ייתכנו אי-דיוקים במיעוט מהשאלות.

שאלות
נפוצות

האם המאגר מתאים לאימון מודלים או רק לבנצ'מרק?

המאגר מיועד במקור להערכה ובנצ'מרק של יכולות קיימות. כמות הדוגמאות קטנה יחסית וכוללת עשרות אלפי רשומות המאורגנות כמבחנים רב-ברירתיים, ולכן הוא לא מתאים כבסיס יחיד לאימון מודל ראייה מאפס.

מה ההבדל המרכזי בין MMMU המקורי לגרסת ה־Pro הזו?

בגרסה הזו סוננו שאלות שמודלי שפה הצליחו לנחש בלי לראות את התמונה כלל. בנוסף, נוספה תצורת עשר אפשרויות ותצורת vision שבה כל השאלה מופיעה כצילום מסך, מה שהוריד דרמטית את אחוזי ההצלחה של המודלים החזקים בשוק.

האם יש במאגר שאלות או מקורות בעברית?

לא. המאגר מוגדר ופועל באנגלית בלבד, ומתמקד בנושאים אקדמיים שנלמדו ונאספו בשפה זו. כדי לבחון מודלים על נתונים חזותיים בעברית תידרשו לתרגם או לייצר מבחן ייעודי משלכם.

האם מותר להשתמש בו בסביבה מסחרית?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא במאגר ללא דרישה להפוך את הקוד שלכם לפתוח. יש להקפיד על מתן קרדיט כנדרש ברישיון ולוודא עמידה בהנחיות זכויות היוצרים שמצוינות בתיעוד.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset ישירות מ־Hugging Face, ללא צורך בהרשאת גישה מוקדמת. המאגר מכיל קובצי parquet ומחולק לשלוש תצורות: vision, standard (4 options) ו־standard (10 options). בשאלות הרגילות מקבלים שדות כמו question, options, answer, תמונות משויכות ו־explanation. בתצורת vision מקבלים רק את מזהה השאלה, הנושא, שדה התשובה והתמונה המכילה את כל המידע הנדרש לפענוח.

from datasets import load_dataset

ds = load_dataset("MMMU/MMMU_Pro")

הרישיון

המאגר מופץ ברישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, בכפוף למתן קרדיט וצירוף עותק הרישיון המקורי. הרישיון חל על המאגר ואינו כובל מודלים שאומנו או הוערכו עליו ברישיון זהה. היוצרים מציינים שהנתונים נאספו תוך הימנעות מהפרת זכויות יוצרים ומזמינים לפנות אליהם להסרת תכנים מפרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗