GPT
C

Chinese-SimpleQA

קוד פתוח

OpenStellarTeamcc-by-nc-sa-4.02024-11-11

מאגר מבחן של שאלות קצרות להערכת דיוק עובדתי של מודלי שפה בסינית. הוא נבנה כמענה מקומי לגרסת SimpleQA של OpenAI עם תשובות קבועות שאינן משתנות בזמן.

  • 2,925הורדות בחודש
  • 37לייקים

מה זה

המאגר כולל 3,000 שאלות קצרות עם תשובות מוגדרות שנועדו לבדוק הזיות של מודלים בסינית, בניגוד למבחנים אמריקאיים סגורים כמו CMMLU או C-Eval. הנתונים מחולקים לשישה תחומים ראשיים: תרבות סינית, מדעי הרוח, הנדסה וטכנולוגיה, אמנות ותרבות חיים, חברה, ומדעי הטבע. התחומים האלה מתפצלים לתשעים ותשעה תתי נושאים שונים כדי לייצר פיזור רחב של ידע כללי.

לפי כרטיס הדגם, צוות הפיתוח העביר את הנתונים בקרת איכות קפדנית כדי להבטיח עובדות מדויקות, אם כי תהליך הסינון עצמו והמקור המדויק שממנו נשלפו השאלות אינם מפורטים בכרטיס. כל השאלות נבחרו כך שהתשובה עליהן תישאר יציבה ולא תהיה תלויה בזמן או באירועים שוטפים.

מתאים ל

  • מדידת הזיות בסינית

    בדיקה אוטומטית של רמת הדיוק העובדתי במודלים שפולטים סינית, באמצעות שאלות קצרות ותשובה חד משמעית.

  • השוואת מודלים למבחן OpenAI

    הרצת הערכה מקבילה למבחן SimpleQA של OpenAI כדי לראות איך מודל מתמודד עם עובדות מחוץ לשפה האנגלית.

  • ולידציה בקרת איכות מקומית

    שילוב בקובצי בדיקה פנימיים למחקר אקדמי שמחפש לכמת טעויות עובדתיות לפני שחרור גרסת מודל.

איפה זה נופל

המאגר כתוב כולו בסינית בלבד ואין בו שום תמיכה בעברית או באנגלית, כך שהוא לא יעזור להערכת מודלים בשפות מקומיות. גיל המקורות לא מצוין בכרטיס, והיוצרים לא מפרטים אילו הטיות תרבותיות או פוליטיות קיימות בבחירת השאלות. בנוסף, מדובר במבחן סטטי המוגבל לשאלות קצרות של עובדה אחת, ולכן הוא לא בודק יכולות הנמקה, ניתוח מעמיק או יצירה של טקסט מורכב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 והוא אוסר שימוש מסחרי באופן מפורש. המאגר מיועד לצורכי מחקר והערכה בלבד, וכל תוצר נגזר חייב להישאר תחת אותו רישיון מגביל.

האם יש במאגר שאלות בעברית או באנגלית?

לא, המאגר ממוקד כולו בשפה הסינית ואין בו נתונים בשפות אחרות. הוא לא יסייע לבדיקת מודלים שפועלים בשוק הישראלי, אלא אם המטרה היא ספציפית תמיכה בעובדות בסינית.

במה הוא שונה ממאגרי מבחן סיניים כמו CMMLU?

ההבדל המרכזי הוא סוג השאלות. מבחנים קודמים התבססו על שאלות רב ברירה, בעוד המאגר הזה כולל שאלות פתוחות קצרות שמיועדות לבדיקת הזיות ישירה של המודל.

מאיזה מקור נאספו השאלות?

כרטיס המאגר מציין רק בקרת איכות קפדנית וחלוקה לנושאים, אך אינו מפרט את מקורות המידע הגולמיים. לפרטים מעמיקים יותר על אופן האיסוף יש לפנות למאמר המחקרי המקושר.

איך טוענים

הגישה למאגר פתוחה לחלוטין ואינה דורשת אישור מיוחד או מפתח גישה. הנתונים זמינים ישירות מתוך המאגר בקובצי csv ו־jsonl פשוטים שנקראים chinese_simpleqa. המבנה מבוסס על שאלות ותשובות קצרות, מה שמאפשר להריץ בדיקות אוטומטיות מהירות בעזרת מודל שופט כמו ממשקי ה־API של OpenAI, בלי לבזבז זמן חישוב יקר על בדיקת טקסטים ארוכים.

from datasets import load_dataset

ds = load_dataset("OpenStellarTeam/Chinese-SimpleQA")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג שהוא, חובת מתן קרדיט מלא ליוצרים, ודרישה לשתף כל נגזרת תחת אותו הרישיון בדיוק. אם תאמנו או תכיילו עליו מודל, לא תוכלו למכור אותו או להציע אותו כשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗