GPT
T

tinyMMLU

קוד פתוח

tinyBenchmarksרישיון לא דווח2024-02-22

גרסה מכווצת של בנצ'מרק MMLU שכוללת 100 שאלות בלבד. מתאימה למי שרוצה לקבל הערכת ביצועים מהירה למודל שפה בלי לשרוף שעות חישוב.

  • 5,066הורדות בחודש
  • 24לייקים

מה זה

המאגר מכיל תת קבוצה מדויקת של 100 דוגמאות שנבחרו מתוך הבנצ'מרק המקורי MMLU, המיועד למשימות שאלות ותשובות. כל רשומה כוללת את אותם המאפיינים שהיו במקור, לצד שדה נוסף שכולל את הדוגמאות כשהן כבר מפורמטות לפי הסטנדרט של Open LLM Leaderboard, כולל דוגמאות ההקשר הנדרשות לפרומפט.

הנתונים במאגר מחולקים לקבצים בפורמט Parquet, כאשר ניתן למצוא חלוקות לסטים כמו dev ו־test. המטרה של הדגימה המצומצמת הזו היא לאפשר הרצה קלה ומהירה של הערכת יכולות, תוך שמירה על יכולת לשערך את הציון המלא של המודל באמצעות כלים סטטיסטיים ייעודיים כמו מודל IRT שנשען על סדר השאלות המקורי.

מתאים ל

  • בדיקת שפיות למודל חדש

    הרצה מהירה של 100 שאלות כדי לראות אם המודל עובד ולא התרסק, לפני ששולחים אותו לבנצ'מרק מלא.

  • שילוב ב־CI/CD

    הערכת ביצועים זולה של מודלים בסביבת פיתוח אוטומטית שרצה בכל עדכון משקולות.

  • שערוך ציוני MMLU

    חישוב ציון משוער לבנצ'מרק MMLU בעזרת ספריית tinyBenchmarks וחיסכון במשאבי מחשוב.

איפה זה נופל

הבנצ'מרק כולל 100 שאלות בלבד ובנוי אך ורק באנגלית, כך שהוא לא נותן שום אינדיקציה ליכולות בעברית או במשימות שאינן מענה על שאלות רב-ברירה. מעבר לכך, צמצום של אלפי שאלות למאה פריטים מסתמך לחלוטין על מודל שערוך סטטיסטי, ולא מציג את כל הפינות והנושאים של המבחן השלם. הנתונים מבוססים על MMLU המקורי, ולכן כל מגבלה, טעות או הטיה שהיו במאגר ההיסטורי נגררו גם לכאן.

שאלות
נפוצות

האם יש במאגר שאלות בעברית?

לא. כל 100 השאלות בדאטהסט הן באנגלית בלבד, בדיוק כמו במאגר MMLU המקורי שממנו הן נדגמו.

מותר להשתמש בזה לפרויקט מסחרי?

לא נמסר רישיון בכרטיס המאגר. בהיעדר רישיון מפורש, אין היתר שימוש ברור ומומלץ שלא להסתמך עליו במוצרים מסחריים בלי בדיקה משפטית.

איך מחלצים ציון מתוך 100 שאלות בלבד?

משתמשים בספריית tinyBenchmarks או ב־lm-evaluation-harness. הכלים האלה מיישמים מודל סטטיסטי בשם IRT++ שמשערך את הציון המלא לפי דפוס התשובות על 100 השאלות.

האם צריך חומרה חזקה כדי להריץ את הבדיקה?

לא. מדובר במאה דוגמאות בלבד, כך שניתן להריץ את ההערכה תוך דקות ספורות גם על מחשב יחיד עם מעבד גרפי פשוט יחסית.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון על ידי משיכת ה־test split של tinyBenchmarks/tinyMMLU, ללא צורך באישור גישה או הרשמה מוקדמת. הקבצים יושבים בפורמט Parquet קליל. אפשר להריץ את הבדיקה אוטומטית בעזרת lm-evaluation-harness החל מגרסה 0.4.1 עם המשימה tinyMMLU, או להוריד ידנית, לחשב וקטור תשובות ולהשתמש בחבילת tinyBenchmarks. אם מריצים על כמה כרטיסי מסך במקביל, סדר הפלטים עלול להשתנות, וחובה לסדר אותם מחדש לפי הסדר המקורי כדי שהשערוך הסטטיסטי יעבוד.

from datasets import load_dataset

ds = load_dataset("tinyBenchmarks/tinyMMLU")

הרישיון

היוצרים לא ציינו רישיון בתיעוד המאגר. מבחינה משפטית מדובר במצב לא מוגדר, כך שאין היתר ברור לשימוש מסחרי, לא ברורות דרישות הייחוס, ולא ידוע אם מותר לשלב את הדאטהסט בתהליכי פיתוח של מוצר מסחרי. לפני שמריצים עליו משהו שאינו מחקר פנימי, יש לברר מול היוצרים או לבדוק את הרישיון של MMLU המקורי.

הרישיון המלא ב־Hugging Face ↗