GPT
C

cmmlu

קוד פתוח

lmlmcatcc-by-nc-4.02023-06-25

  • chinese
  • llm
  • evaluation

מבחן ידע רחב בסינית שנועד לבדוק יכולות שפה, תרבות והיגיון של מודלים. המאגר מתאים למי שרוצה להעריך ביצועים מול שאלות מורכבות שמקורן לא בתרגום מאנגלית.

  • 44,614הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל שאלות ברירה מרובה בסינית שמכסות שישים ושבעה נושאים שונים. התחומים נעים בין מדעים מדויקים כמו פיזיקה ומתמטיקה שדורשים יכולת חישובית, ועד למדעי הרוח והחברה ברמות קושי שמתחילות בבית ספר יסודי ומגיעות עד לרמה מקצועית מתקדמת. השאלות כוללות ארבע אפשרויות תשובה עם תשובה נכונה אחת בלבד לכל שאלה.

התוכן מחולק לערכות פיתוח ובדיקה עבור כל אחד משישים ושבעת הנושאים. בכל נושא תמצאו חמש שאלות בערכת הפיתוח ומעל מאה שאלות בערכת הבדיקה, כשהיקף הרשומות הכולל במאגר עומד בין עשרת אלפים למאה אלף שאלות. הכותבים מציינים שחלק גדול מהשאלות מבוסס על ניואנסים לשוניים והקשר תרבותי מקומי שלא ניתנים לתרגום ישיר משפות אחרות, וחלק מהתשובות נכונות ספציפית בתוך ההקשר של סין.

מתאים ל

  • הערכת מודלים בסינית

    בדיקת יכולות הבנה והיגיון של מודלי שפה בשישים ושבעה מקצועות שונים בשפה הסינית.

  • מבחני תרבות וידע מקומי

    מדידת ביצועים על שאלות שנכתבו במקור בהקשר סיני ולא תורגמו מאנגלית.

  • השוואת ביצועים למחקר

    בדיקת יכולת המודל במשימות רב ברירה במדעים מדויקים ומדעי הרוח עבור מאמרים אקדמיים.

איפה זה נופל

המאגר מוגבל כולו לשפה הסינית ואינו כולל שפות אחרות או תרגומים. חלק מהתשובות מותאמות ישירות למציאות, לחוקים או לתרבות בסין, ולכן הן לא בהכרח נכונות או רלוונטיות באזורים גאוגרפיים אחרים. בנוסף, ערכת הפיתוח קטנה מאוד וכוללת חמש שאלות בלבד לכל נושא, מה שמגביל את היכולת להשתמש בו ללימוד מבוסס דוגמאות מרובות לפני המבחן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המדווח הוא רישיון לא מסחרי, שמגביל את השימוש למחקר, הערכה ובדיקות פנימיות בלבד. אם המטרה היא להפיק רווח מהמודל שאומן עליו, הדאטהסט הזה לא מתאים.

האם יש במאגר שאלות בעברית או באנגלית?

המאגר בנוי כולו בסינית בלבד ומיועד לבחון שליטה בה. אין בו שאלות בשפות אחרות, והמחברים אף הדגישו שחלק גדול מהשאלות אינו ניתן לתרגום ישיר בגלל הקשר תרבותי ומקומי.

איך המאגר מחולק בפועל?

הנתונים מחולקים לשישים ושבעה נושאים שונים. בכל נושא יש ערכת פיתוח שמכילה חמש שאלות בלבד, וערכת מבחן שמכילה מעל מאה שאלות בתבנית אמריקאית עם ארבע ברירות.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset רגילה עם ציון תת הנושא הרצוי, למשל אגרונומיה. המאגר פתוח לגישה ישירה ואינו דורש אישור מיוחד, והוא כולל ארבעה קבצים שהמרכזי בהם הוא קובץ זיפ וסקריפט טעינה בפייתון. המבנה מציג שדות של שאלת מקור, ארבע אפשרויות בחירה ותשובה נכונה, ומאפשר בדיקה ישירה על ערכת המבחן או שימוש בדוגמאות המעטות של ערכת הפיתוח לצורך בדיקות פרומפטים.

from datasets import load_dataset

ds = load_dataset("lmlmcat/cmmlu")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שאינו מתיר שימוש מסחרי, אם כי בכרטיס עצמו נזכר גם הרישיון המחמיר יותר cc-by-nc-sa-4.0. לא ניתן להשתמש בנתונים האלה לאימון מוצר מסחרי, וכל שימוש מחקרי מחייב ייחוס ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗