GPT
M

MMLU-ProX

קוד פתוח

li-labmit2025-03-13

מבחן ביצועים רב לשוני להערכת מודלי שפה על שאלות ידע מורכבות עם עשר אפשרויות בחירה. המאגר מתאים למי שרוצה לבדוק עמידות של מודל בשפות שונות מעבר לאנגלית.

  • 5,156הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל שאלות רב ברירה שמחולקות לקונפיגורציות לפי שפות שונות, כמו אנגלית, ערבית, גרמנית, רוסית ושפות נוספות. כל שפה כוללת פיצול אימות קטן של 70 דוגמאות ופיצול מבחן עיקרי שמכיל בדיוק 11,759 דוגמאות. המבנה האחיד הזה מאפשר השוואה ישירה של תוצאות המודל בין שפה לשפה על אותו היקף נתונים.

המבנה של כל רשומה כולל מזהה שאלה, שאלת ידע בטקסט חופשי, עשר אפשרויות בחירה שונות ממוספרות מאפס עד תשע, התשובה הנכונה ואינדקס התשובה. בנוסף, הרשומות כוללות שדה של שרשרת מחשבה, קטגוריית ידע, ושדות שמצביעים על מקור השאלה והמזהה המקורי שלה. המקורות המדויקים ושיטות הסינון של הנתונים לא מפורטים בכרטיס.

מתאים ל

  • הערכת מודלים רב לשוניים

    מדידת יכולת הסקת המסקנות של מודל שפה בעשרות שפות שונות תחת מבנה שאלות אחיד.

  • אימון שרשרת מחשבה

    שימוש בשדה ההסברים כדי לאמן מודלים להפיק נימוק לוגי לפני שהם בוחרים תשובה סופית.

  • בדיקת ביצועים בערבית

    בחינת יכולות המודל בשפה הערבית על פני קרוב לשנים עשר אלף שאלות מבחן שונות.

איפה זה נופל

החיסרון הבולט ביותר לקורא הישראלי הוא שעברית אינה נכללת ברשימת השפות. בנוסף, כרטיס הדאטהסט לא מפרט כיצד נוצרו התרגומים לשפות השונות, האם הם עברו בקרת איכות אנושית, או שמדובר בתרגום מכונה שעלול לכלול שגיאות ניסוח והטיות תרבותיות. פיצול האימות קטן מאוד וכולל 70 דוגמאות בלבד לכל שפה, מה שמקשה על כוונון עדין אמין לפני ההרצה על סט המבחן.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא, עברית אינה מופיעה ברשימת השפות הקיימות במאגר. אם אתם מחפשים להעריך מודלים בעברית תצטרכו למצוא מקורות חלופיים. קיימות במאגר שפות אחרות מהאזור, כמו ערבית.

האם מותר להשתמש בנתונים לפרויקט מסחרי?

כן, הנתונים מפורסמים תחת רישיון MIT שמתיר שימוש מסחרי מלא. אתם רשאים להעריך או לאמן מודלים מסחריים על בסיסו. הדרישה היחידה היא לצרף את נוסח הרישיון המקורי ולתת קרדיט ליוצרים.

כמה שטח אחסון דרוש כדי להוריד את הדאטהסט?

נפח ההורדה לכל שפה בודדת נע בין 5 ל־15 מגה בייט בלבד. המאגר כולו שמור בקובצי פרקט דחוסים ויעילים. אין צורך בתשתית אחסון כבדה כדי לטעון אותו לזיכרון.

כיצד נאספו השאלות והאם מדובר בתרגום מכונה?

כרטיס המאגר לא מפרט את אופן האיסוף או האם התבצע תרגום אנושי. השדות כוללים מזהה מקור עבור השאלות המקוריות, אך אין תיעוד על בקרת האיכות. מומלץ לדגום ידנית רשומות בשפת היעד לפני שמסתמכים על התוצאות.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס של האגינג פייס לפי שם השפה המבוקשת, למשל ערבית או אנגלית. המאגר פתוח לציבור ואינו דורש אישור גישה מוקדם. הנתונים שמורים בקובצי פרקט קלים, כך שכל שפה שוקלת בין חמישה לחמישה עשר מגה בייט להורדה. בעיבוד הנתונים צריך לשים לב לשדות של עשר האפשרויות, לשדה קטגוריית השאלה ולתוכן שרשרת המחשבה כדי לבנות פרומפט הערכה מתאים.

from datasets import load_dataset

ds = load_dataset("li-lab/MMLU-ProX")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ללא תשלום תמלוגים, ומחייב רק מתן קרדיט ושמירה על הודעת הרישיון המקורית. הרישיון אינו כופה פתיחת קוד של מודל שנבדק או אומן על הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗