GPT
G

Global-MMLU

קוד פתוח

CohereLabsapache-2.02024-12-01

  • argilla

שאלות רב-ברירה להערכת מודלים בעשרות שפות, כולל עברית וערבית. במקום עוד מבחן אנגלוצנטרי, יש כאן תיוג מפורט של רגישות תרבותית, אזור ומדינה.

  • 48,437הורדות בחודש
  • 163לייקים

מה זה

המאגר מציע גרסה רב-לשונית למבחן הידע המוכר, כשהוא מחולק לתצורות לפי שפה, מקוד am ועד ru, כולל he לעברית. כל תצורה מכילה שני פיצולים: dev עם 285 דוגמאות ו־test עם 14,042 שאלות. המבנה אחיד לגמרי בכל השפות ומכיל כמות דוגמאות זהה.

כל רשומה בנויה משאלה, ארבע אפשרויות תשובה (a עד d) והתשובה הנכונה. מעבר לתוכן הבסיסי, CohereLabs צירפו שדות מטא-דאטה נרחבים: תחום ידע, קטגוריית על, מקור הנתונים, תלות בזמן, וכן שדות הקשר כמו תרבות, אזור, מדינה ותגית רגישות תרבותית. קיים גם שדה בוליאני שמציין האם הדוגמה עברה אנוטציה.

מתאים ל

  • בנצ'מרק רב-לשוני

    השוואת ביצועי מודלים שונים בעברית ובשפות נוספות על סט שאלות זהה ומובנה.

  • בדיקת הטיות תרבותיות

    ניתוח דיוק המודל לפי פילוח גיאוגרפי ותרבותי באמצעות תגיות הרגישות המובנות.

  • אימון ובדיקת שאילתות

    שימוש בסט ה־dev לכיול פרומפטים ובדיקות Few-Shot במשימות שאלות ותשובות.

איפה זה נופל

גודל הפיצולים זהה לחלוטין בכל השפות, מה שמעיד בסבירות גבוהה על תרגום של אותו סט בסיס ולא על איסוף מקומי עצמאי בכל שפה. כדאי לבדוק לעומק את איכות התרגום בעברית לפני שמסתמכים על התוצאות, שכן תרגום מכונה של שאלות ידע עלול לייצר ניסוחים עילגים או לא מדויקים. בנוסף, קיומו של שדה time_sensitive דורש סינון של שאלות שתשובתן השתנתה מאז יצירתן.

שאלות
נפוצות

האם הדאטהסט כולל שאלות בעברית?

כן, קיימת תצורה מלאה לעברית תחת הקוד he. היא כוללת 285 שאלות בפיצול dev ו־14,042 שאלות בפיצול test, בדיוק כמו ביתר השפות במאגר.

מותר להשתמש בו לפרויקט מסחרי?

כן, הרישיון הוא apache-2.0 שמתיר שימוש מסחרי מלא. אתם יכולים להעריך מודלים מסחריים או להשתמש בנתונים בהתאם לתנאי הרישיון והקרדיט הנדרש.

כמה מקום צריך כדי להוריד את הנתונים?

הנתונים מחולקים לפי שפות בפורמט parquet יעיל. עבור עברית בלבד מדובר בכ־9 מגה-בייט להורדה וכ־10.4 מגה-בייט פרוס, כך שלא נדרש נפח אחסון חריג.

איך טוענים

טוענים ישירות דרך Hugging Face Datasets על ידי ציון שם המאגר והשפה הרצויה בפרמטר התצורה, למשל he לעברית. הקבצים שמורים בפורמט parquet ומחולקים לפי תיקיות שפה, כך שאין צורך להוריד את כל המאגר בבת אחת. אין צורך בבקשת גישה מיוחדת או באישור ידני. שדות המפתח לבדיקת המודל הם השאלה, ארבע האפשרויות ועמודת answer להשוואת התוצאה.

from datasets import load_dataset

ds = load_dataset("CohereLabs/Global-MMLU")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי ומחקר ללא תשלום, ומאפשר לאמן ולהעריך מודלים חופשי. נדרש לשמור על הודעת זכויות היוצרים והרישיון המקורי, אך אין חובה לשתף נגזרות תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗