GPT
G

Global-MMLU-Lite

קוד פתוח

CohereLabsapache-2.02024-12-12

  • argilla

גרסה מצומצמת של בנצ׳מרק MMLU שנועדה לבחון מודלים בריבוי שפות. תקבלו כאן שאלות שעברו תרגום ועריכה אנושית עם חלוקה מפורשת לדגימות תלויות תרבות וכאלה שלא.

  • 43,988הורדות בחודש
  • 43לייקים

מה זה

המאגר כולל 23 שפות, ובהן ערבית, בנגלית, צ׳כית, אנגלית, ספרדית, צרפתית, הינדי, הונגרית, גרמנית, אינדונזית, איטלקית וולשית. בכל שפה תמצאו 400 דוגמאות בלבד. 200 דוגמאות מוגדרות כרגישות תרבותית, ועוד 200 דוגמאות מוגדרות כנטולות הקשר תרבותי מובהק. הרעיון הוא לתת לכם מבחן מהיר וממוקד במקום להריץ אלפי שאלות כבדות.

התוכן עצמו לא נוצר בתרגום מכונה עיוור. לפי התיעוד, כל הדגימות בגרסת הלייט עברו תרגום אנושי מלא או עריכה אנושית לאחר תרגום. חלק מהשפות נלקחו ישירות ממאגר Global-MMLU המקורי, ואחרות נוספו בעדכונים מאוחרים יותר של הפרויקט.

מתאים ל

  • בדיקת מודלים רב-לשוניים

    הרצה מהירה של מבחני ביצועים בשפות שונות כדי לראות אם המודל שומר על יכולת הסקה זהה.

  • מדידת הטיות תרבותיות

    השוואת הציונים בין 200 השאלות תלויות התרבות לבין 200 השאלות הכלליות בכל שפה.

  • סינון גרסאות בפיתוח

    שימוש בערכת מבחן קלה וזולה להרצה כדי לפסול מודלים חלשים לפני בדיקה מקיפה ויקרה.

איפה זה נופל

החיסרון המרכזי עבור מי שמפתח בארץ ברור מיד: עברית לא מופיעה כאן בכלל, למרות שיש ייצוג לשפות כמו ערבית, צ׳כית וולשית. מעבר לזה, מדובר במדגם קטן מאוד של 400 שאלות לשפה. הוא טוב כדי לקבל אינדיקציה ראשונית על יכולות המודל, אבל מסוכן להסתמך עליו כמדד יחיד לפני שמעלים מודל לפרודקשן אמיתי.

שאלות
נפוצות

האם יש במאגר שאלות בעברית?

לא. המאגר מכיל 23 שפות שונות, כולל ערבית, אנגלית, צרפתית וגרמנית, אך עברית אינה נכללת בו. אם המטרה שלכם היא להעריך ביצועים בעברית, תצטרכו לחפש מקור אחר.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה. אתם רק נדרשים לציין את המקור ולצרף את תנאי הרישיון.

איך נאספו ותורגמו השאלות?

הנתונים מתבססים על שאלות מסוג MMLU, כאשר כל הדגימות בגרסה הזו עברו תרגום אנושי או עריכה אנושית קפדנית. החלוקה הפנימית נקבעה מראש ל־200 שאלות בעלות הקשר תרבותי ו־200 שאלות ניטרליות.

מה ההבדל בין גרסת הלייט למאגר המלא?

גרסת הלייט מכילה רק 400 שאלות לכל שפה, במטרה לאפשר בדיקה מהירה וחסכונית במשאבים. המאגר המלא כולל היקף נרחב בהרבה של שאלות בכל תחום.

איך טוענים

הנתונים שמורים בקובצי parquet ומחולקים לפי קודי שפות ולפי פיצולים של dev ושל test. המאגר פתוח לציבור ואין צורך לבקש אישור גישה מיוחד מיוצריו כדי להוריד אותו. אתם פשוט מושכים את השפה הספציפית שמעניינת אתכם או את כל 49 הקבצים שבמאגר, בלי להתעסק עם המרות פורמטים מורכבות.

from datasets import load_dataset

ds = load_dataset("CohereLabs/Global-MMLU-Lite")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר לכם להשתמש בנתונים למטרות מסחריות ומחקריות, לשנות אותם ולשלב אותם בפיתוחים שלכם. התנאי המרכזי הוא מתן קרדיט מתאים ושמירה על תנאי הרישיון המקורי, בלי חובה לשחרר את המודלים שלכם באותו אופן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗