GPT
C

ceval-exam

קוד פתוח

cevalcc-by-nc-sa-4.02023-05-16

מאגר שאלות רב ברירה לבחינת מודלי שפה בסינית במגוון רחב של מקצועות אקדמיים ומבחני הסמכה. הוא משמש מדד השוואתי ליכולות הבנה וידע כללי בשפה שאינה אנגלית.

  • 186,935הורדות בחודש
  • 313לייקים

מה זה

הרשומות בנויות במבנה קלאסי של מבחן רב ברירה. כל פריט כולל מזהה, שאלה, ארבע אפשרויות בחירה מ־A עד D, תשובה נכונה והסבר מלא לפתרון.

התוכן נחלק לעשרות תחומי ידע שונים. תמצאו שם מקצועות מבית ספר תיכון וחטיבת ביניים כמו מתמטיקה, כימיה והיסטוריה, קורסים אקדמיים ברמת אוניברסיטה כגון תכנות, רפואה קלינית וכלכלה, ומבחני הסמכה מקצועיים למקצועות כמו הנהלת חשבונות, שירות המדינה, עריכת דין והנדסת בטיחות אש.

כל מקצוע כזה מוגדר כהגדרה נפרדת עם חלוקה קבועה לשלושה חלקים: בדיקה, תיקוף, וחלק פיתוח קטן שמכיל חמש דוגמאות בודדות בכל נושא לצורך למידה מכמה דוגמאות.

מתאים ל

  • מבחן ביצועים למודלים

    בדיקת יכולות ההסקה והידע של מודל שפה מול בנצ׳מרק סטנדרטי בסינית.

  • אימון מודל רב ברירה

    לימוד מודלים לפתור שאלות מבחן ולבחור בין אפשרויות שונות.

  • הערכת תרגום והבנה

    בדיקה האם מודלים רב לשוניים מצליחים להבין מושגים מקצועיים בסינית.

איפה זה נופל

כל התוכן כתוב בסינית בלבד, כך שלמי שמפתח מודלים בעברית או באנגלית אין מה לעשות איתו באופן ישיר. המאגר מודד ידע ספציפי למערכת החינוך והחוק הסינית, כולל נושאים מקומיים מובהקים כמו מחשבת מאו דזה דונג ומרקסיזם. בנוסף, רמת הקושי של המבחנים המקצועיים גבוהה מאוד ומבוססת על ידע עובדתי נוקשה, מה שלא מייצג שיחה טבעית של משתמשים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון כולל סעיף NC שאוסר שימוש מסחרי מכל סוג. הוא מתאים למחקר אקדמי, בדיקות פנימיות או פיתוח מודלים בקוד פתוח שלא למטרות רווח.

האם יש במאגר שאלות בעברית או באנגלית?

לא, כל השאלות וההסברים כתובים בסינית. אם אתם עובדים על מוצר לשוק הישראלי, הנתונים האלה לא יעזרו לכם אלא אם כן אתם בודקים יכולת רב לשונית רחבה של מודל גדול.

איך בנויים הנתונים בתוך המאגר?

המאגר מחולק לקונפיגורציות לפי נושאים, שבכל אחת יש חלוקה ל־test, val ו־dev. כל רשומה כוללת מזהה, שאלת טקסט, ארבע אפשרויות בחירה, את התשובה הנכונה והסבר מנומק.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין להורדה. הנתונים שמורים בקובצי parquet שמחולקים לפי תחומי הידע, כך שאפשר למשוך נושא בודד כמו תכנות או רפואה בלי להוריד את כל המאגר. שדות החובה לשימוש במודל הם הטקסט של השאלה והאפשרויות, והשדות של התשובה וההסבר משמשים להערכה או לבניית פרומפטים.

from datasets import load_dataset

ds = load_dataset("ceval/ceval-exam")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות פשוטה: השימוש מוגבל למחקר ולמטרות לא מסחריות בלבד, חייבים לתת קרדיט למפרסמים, וכל מאגר או יצירה נגזרת שתפיצו חייבים לצאת תחת אותו הרישיון בדיוק. אם תאמנו עליו מודל, אסור יהיה לכם למכור אותו או לספק באמצעותו שירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗