GPT
T

tmmluplus

קוד פתוח

ikalamit2023-12-22

  • traditional chinese
  • finance
  • medical
  • taiwan
  • benchmark

מבחן ידע רב תחומי בסינית מסורתית עם שאלות רב ברירה מטייוואן. הוא נותן מדד אמין למודלים שצריכים להבין את ההקשר המקומי, המקצועי והחוקי של האזור.

  • 4,369הורדות בחודש
  • 151לייקים

מה זה

המאגר מכיל שאלות מבחן אמריקאי בארבע קטגוריות ראשיות: מדעים מדויקים והנדסה, מדעי החברה, מדעי הרוח, ותחומים מעשיים שכוללים רפואה, עסקים ונושאים כלליים. התוכן מחולק ל־66 מקצועות לימוד שונים, מרמת בית ספר יסודי ועד בחינות הסמכה מקצועיות, תוך התמקדות בחינוך ובחוק הנהוגים בטייוואן. המבנה מורכב מקובצי CSV נפרדים לכל נושא, שכוללים שאלת בסיס, ארבע אפשרויות בחירה מ־A עד D, והתשובה הנכונה.

גרסה 1.1 של המאגר עברה תהליך ניקוי קפדני של 6,116 שאלות שעוררו חשד בסריקות ממוחשבות. מומחי תוכן בדקו ידנית 691 שאלות בעייתיות, תיקנו את מפתח התשובות ב־197 מקרים, ומחקו לחלוטין 539 שאלות שכללו ניסוחים משובשים או חוסר בהירות משפטית. נכון לגרסה זו נותרו 22,203 שאלות, מתוכן 19,680 מיועדות לבדיקה סופית, 2,202 לתיקוף ו־321 לפיתוח.

מתאים ל

  • הערכת מודלים בסינית

    בדיקת יכולת המודל לענות על שאלות ידע מורכבות בסינית מסורתית.

  • מדידת ידע מקצועי בטייוואן

    השוואת ביצועים מול נבחנים אנושיים בתחומי משפט, ראיית חשבון ורפואה מקומיים.

  • בנצ'מרק חלופי ל־TMMLU

    הרחבת בדיקות קיימות על בסיס נתונים גדול פי שישה ומסונן היטב.

איפה זה נופל

הנתונים כתובים אך ורק בסינית מסורתית ומבוססים על תוכניות הלימודים, המינוחים והחקיקה של טייוואן. לא תמצאו כאן שום מידע בעברית, והחומר אינו מתאים לבדיקת ידע כללי בינלאומי או סינית פשוטה של סין היבשתית. חלק ניכר מהשאלות בתחום המשפט ומדעי החברה משקף חוקים ורגולציות מקומיות, ולכן מודל שיצטיין כאן לא בהכרח יבין עקרונות משפטיים של מדינות אחרות.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא, המאגר כולו כתוב בסינית מסורתית בלבד. הוא מתמקד בהקשר התרבותי, המקצועי והחינוכי של טייוואן. עבור פיתוחים המיועדים לשוק הישראלי הוא לא רלוונטי, אלא אם המטרה היא לבחון מודלים רב-לשוניים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הנתונים פורסמו תחת רישיון MIT שמתיר במפורש שימוש מסחרי. מותר לאמן מודלים, לעבד את הנתונים ולשלב אותם במערכות עסקיות. החובה היחידה היא לצרף את תנאי הרישיון המקוריים ואת הצהרת זכויות היוצרים.

איך נאסף המידע ומה איכותו?

הנתונים נלקחו מבחינות רשמיות בטייוואן מדרגת בית ספר יסודי ועד הסמכות מקצועיות. בגרסה 1.1 הצוות ביצע סריקות אוטומטיות לאיתור שגיאות ולאחריהן בדיקה ידנית של מומחים. במסגרת הבדיקה נמחקו מאות שאלות מעורפלות או לא מעודכנות ותוקנו טעויות במפתחות התשובות.

מה ההבדל בין מאגר זה לגרסת TMMLU המקורית?

המאגר הנוכחי גדול בערך פי שישה מהגרסה הקודמת ומכיל 66 מקצועות לימוד. בנוסף להיקף הנרחב, הוא מספק חלוקה מאוזנת יותר בין תחומי המדעים, מדעי החברה ומקצועות הרפואה והעסקים. גרסה 1.1 גם עדכנה שינויי חקיקה ורגולציה שהפכו את חלק מהשאלות הישנות ללא מדויקות.

איך טוענים

טוענים את הנתונים דרך ספריית datasets ישירות מפייתון, תוך ציון שם הנושא המבוקש מתוך 66 הנושאים, כמו חשבונאות או משפט מנהלי. המאגר פתוח לחלוטין ואינו דורש אישור גישה מוקדם. מומלץ להגדיר במפורש את הגרסה כ־v1.1 כדי לקבל את השאלות המתוקנות. כל שורה מחזירה את גוף השאלה, ארבעת המסיחים ומפתח התשובה באותיות לטיניות.

from datasets import load_dataset

ds = load_dataset("ikala/tmmluplus")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי ומחקרי חופשי, כולל אימון מודלים, עריכה והפצה מחדש. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים וכתב הוויתור המקורי של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗