GPT
M

Multi-subject-RLVR

קוד פתוח

virtuoussyapache-2.02025-03-31

  • reasoning-datasets-competition

המאגר מרכז 638 אלף שאלות מבחן אקדמיות עם תשובות אובייקטיביות ב־48 תחומים שונים. הוא מתאים למי שרוצה לאמן או לבחון מודלים בשיטות למידת חיזוק שדורשות בדיקת נכונות חד-משמעית.

  • 1,278הורדות בחודש
  • 67לייקים

מה זה

הבסיס כאן הוא ExamQA, אוסף שאלות רב-ברירה ברמה אקדמית שנכתבו במקור בסינית על ידי מומחי תוכן למטרות בחינה. כדי להתאים את המידע למשימות מתקדמות, הסירו את המסיחים והפכו כל שאלה למבנה של שאלה ותשובה פתוחה. בנוסף, כל השאלות והאפשרויות תורגמו לאנגלית באמצעות GPT-4o-mini.

המאגר מחולק לשני חלקים עיקריים. חלק המבחן כולל דגימה אקראית של 6,000 שאלות, ושאר הנתונים מיועדים לאימון. מכיוון שהנתונים המקוריים הגיעו ללא שיוך לנושאים, GPT-4o-mini סיווג את השאלות ל־48 תחומים שונים או סימן אותן כלא מסווגות. בסט הבדיקה, 15.8% מהשאלות נותרו ללא סיווג, בעוד שהשאר מתרכזות בעיקר ברפואה בסיסית, משפטים, כלכלה, ניהול, הנדסה אזרחית, מתמטיקה, מדעי המחשב, פסיכולוגיה וכימיה. החוקרים גם קיבצו את התחומים הללו לארבע קטגוריות על: מדעים מדויקים, מדעי החברה, מדעי הרוח ומדעים יישומיים.

מתאים ל

  • אימון RL מבוסס אימות

    אימון מודלים באמצעות תגמולים שניתנים לאימות מהיר מול תשובה אובייקטיבית ידועה.

  • הערכת ביצועים רב-תחומית

    בדיקת יכולות המודל במבחנים אקדמיים ב־48 דיסציפלינות מגוונות בעזרת סט הבחינה.

  • מענה לשאלות ללא מסיחים

    אימון מודלים למענה ישיר וחופשי על שאלות מבחן שבהן הוסרו אפשרויות הבחירה המרובה.

איפה זה נופל

הנתונים אינם חפים מבעיות תרגום וסיווג. כל השאלות תורגמו מסינית לאנגלית באמצעות GPT-4o-mini, כך שטעויות תרגום או ניסוחים מלאכותיים בהחלט קיימים שם. בנוסף, גם שיוך הנושאים נעשה על ידי אותו מודל, וכמעט 16% מהשאלות בסט הבדיקה נותרו ללא סיווג כלל. אין פה נתונים בעברית, וכל התוכן מוגבל לאנגלית בלבד. אם המוצר שלכם דורש דיוק לשוני אותנטי באנגלית או שיוך נושאי מושלם, תצטרכו לדגום ולבדוק את הרשומות בעצמכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, המאגר פורסם ברישיון apache-2.0 שמאפשר שימוש מסחרי חופשי. עליכם רק לציין קרדיט ולצרף את נוסח הרישיון.

האם יש בדאטהסט תוכן בעברית?

לא, אין בו עברית. השאלות נכתבו במקור בסינית ותורגמו בשלמותן לאנגלית.

איך נוצרו השאלות והתשובות?

הבסיס מגיע ממאגר ExamQA שבו מומחים כתבו שאלות רב-ברירה למבחנים אקדמיים בסין. יוצרי המאגר הנוכחי מחקו את המסיחים ותרגמו את השאלות והתשובות לאנגלית באמצעות GPT-4o-mini.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המידע שמור בקבצי Parquet ומחולק מראש לאימון ולבדיקה. אין צורך לבקש אישור גישה, וניתן לטעון אותו מיידית בסביבת הפיתוח.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הנתונים שמורים בשני קבצי Parquet נפרדים, אחד עבור train ואחד עבור test, לצד קובץ התיעוד הבסיסי. אתם יכולים לטעון אותם ישירות דרך ספריית datasets באמצעות המזהה virtuoussy/Multi-subject-RLVR ללא צורך בהגדרות מורכבות.

לפני שמתחילים לאמן, שימו לב שהרשומות מבוססות על שאלות ותשובות שתורגמו וסווגו מחדש. השדות המרכזיים כוללים את הטקסט של השאלה והתשובה האובייקטיבית, לצד הסיווג הנושאי שנוצר על ידי המודל עבור חלוקה לקטגוריות.

from datasets import load_dataset

ds = load_dataset("virtuoussy/Multi-subject-RLVR")

הרישיון

המאגר משוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשתף את הקוד או את המודל שלכם תחת אותו רישיון. כל מה שנדרש הוא לתת קרדיט למפרסמים ולכלול עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗