GPT
A

ArabicMMLU

קוד פתוח

MBZUAIcc-by-nc-4.02024-02-21

  • MMLU
  • exams

מאגר של 14,575 שאלות רב ברירה בערבית ספרותית שנאספו ממבחנים אמיתיים. הוא מיועד למי שרוצה לבדוק ביצועים של מודלי שפה בערבית על מגוון מקצועות לימוד.

  • 6,622הורדות בחודש
  • 39לייקים

מה זה

המאגר מכיל שאלות רב ברירה עם עד 5 אפשרויות תשובה ורק תשובה נכונה אחת לכל שאלה. הנתונים מגיעים ממבחנים בבתי ספר ובאוניברסיטאות ברמות לימוד שונות, ומכסים 40 משימות שונות בתחומי מדעים מדויקים, מדעי החברה, מדעי הרוח, השפה הערבית ותחומים נוספים.

איסוף הנתונים ובניית המאגר נעשו בשיתוף 10 דוברים ילידיים של השפה משמונה מדינות שונות בצפון אפריקה, הלבנט והמפרץ. מקורות המידע המרכזיים שמהם נלקחו השאלות הם ירדן, מצרים ופלסטין. כל החומרים כתובים בערבית ספרותית מודרנית ומחולקים לפי נושאי לימוד וקבצי פיתוח ומבחן.

מתאים ל

  • בנצ'מרק למודלים בערבית

    הערכת ביצועי מודלי שפה בערבית ספרותית על פני 40 תחומי ידע שונים.

  • השוואת פרומפטים

    בדיקת איכות התשובות של מודלים בהרצה עם פרומפטים באנגלית מול ערבית.

  • מדידת יכולות פתרון מבחנים

    בחינת יכולת המודל להתמודד עם שאלות רב ברירה אקדמיות ברמות שונות.

איפה זה נופל

כל השאלות מנוסחות בערבית ספרותית מודרנית בלבד. אם המוצר שלכם פונה למשתמשים בניבים מדוברים, המאגר לא משקף את השפה שלהם. בנוסף, רוב השאלות מגיעות משלוש מדינות בלבד, ירדן, מצרים ופלסטין, כך שיש הטיה לחומרי לימוד ולתכנים תרבותיים מאזורים אלה. החוקרים גם מציינים שבבדיקות שלהם דווקא פרומפטים באנגלית הניבו תוצאות טובות יותר בהערכת המודלים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון של המאגר הוא cc-by-nc-4.0 שמגביל את השימוש למטרות לא מסחריות בלבד. מותר להשתמש בו למחקר אקדמי, בדיקות פנימיות והערכת מודלים במעבדה. אם המטרה היא לאמן מודל למכירה או לשירות בתשלום, המאגר הזה אינו מתאים.

האם המאגר כולל עברית או ניבים ערביים מדוברים?

המאגר אינו מכיל עברית כלל. כל 14,575 השאלות כתובות בערבית ספרותית מודרנית בלבד. הוא אינו מיועד לבדיקת הבנה של ערבית מדוברת או להערכת מודלים בעברית.

מאיפה נאספו השאלות?

השאלות נאספו ממבחנים אמיתיים של בתי ספר ואוניברסיטאות משמונה מדינות שונות. תהליך האיסוף והעיבוד כלל עשרה דוברים ילידיים, ורוב השאלות הגיעו מחומרי לימוד בירדן, מצרים ופלסטין. הן מכסות מקצועות כמו מדעים, שפה והומניסטיקה.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

הנתונים מחולקים ל־84 קבצי CSV לפי נושאי לימוד, עם פיצול מוגדר מראש לקבצי dev ו־test. אפשר לטעון אותם בשורת קוד אחת דרך ספריית Hugging Face Datasets ללא צורך בהרשמה מוקדמת או אישור מיוחד. כל רשומה כוללת שאלה, אפשרויות בחירה והתשובה הנכונה.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה load_dataset('MBZUAI/ArabicMMLU'). אין צורך בבקשת גישה מיוחדת, והמאגר פתוח להורדה. הוא כולל 84 קבצים בפורמט CSV המחולקים לפי נושאים, כמו דקדוק בערבית או חשבונאות, עם פיצול מובנה לתיקיות פיתוח ובדיקה. השדות המרכזיים כוללים את תוכן השאלה, אפשרויות הבחירה והתשובה הנכונה.

from datasets import load_dataset

ds = load_dataset("MBZUAI/ArabicMMLU")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה, אסור להשתמש בנתונים האלה לכל מטרה מסחרית. מותר להשתמש בהם למחקר, הערכה ובדיקות פנימיות, תוך מתן קרדיט מלא ליוצרים. אימון מודל שנועד להפצה מסחרית על בסיס הנתונים האלה מפר את תנאי הרישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗