GPT
E

Eurus-2-RL-Data

קוד פתוח

PRIME-RLmit2024-12-31

מאגר לאימון מודלים בלמידת חיזוק על מתמטיקה ותכנות תחרותי. הוא מתאים למי שחייב אימות תוצאה אוטומטי, עם תשובות סופיות בלטך ומקרי בדיקה לקוד.

  • 968הורדות בחודש
  • 58לייקים

מה זה

המאגר מכיל מעל 480 אלף דוגמאות אימון, עם הטיה מובהקת לכיוון מתמטיקה שכוללת כ־455 אלף בעיות, לצד כ־25 אלף בעיות תכנות. פיצול הוולידציה מכיל 2,048 שאלות, מחולק חצי בחצי בין שני התחומים. כל רשומה כוללת את מקור הנתונים, הפרומפט, סוג היכולת, מידע נוסף, ומודל תגמול שמכיל קלט ומחרוזת תשובה סופית בפורמט מובנה.

בעיות המתמטיקה נלקחו ממאגר NuminaMath-CoT ומכסות מרמה של תיכון בסין ועד אולימפיאדת המתמטיקה הבינלאומית. היוצרים העבירו את השאלות האמריקאיות המרה לשאלות פתוחות עם תשובה בתוך תיבת לטך, ואימתו את הפתרונות מול מודלים כמו QwQ-32B ו־Qwen2.5-Math-72B בחמש הרצות שונות. בעיות התכנות נאספו ממאגרים כמו APPS, CodeContests, TACO ו־Codeforces, ועברו בעיקר סינון של כפילויות.

מתאים ל

  • אימון RL למתמטיקה

    אימון מודלי שפה על הנמקה מתמטית בעזרת אימות תוצאה אוטומטי של פתרונות מבוססי לטך.

  • אימון מודלים לתכנות

    תרגול מודלים בפתרון בעיות קוד אלגוריתמיות והערכת הריצה מול מקרי בדיקה מובנים.

  • בניית מודלי תגמול

    פיתוח מערכות שמעריכות נכונות של צעדי פתרון בבעיות חשיבה מורכבות.

איפה זה נופל

אם אתם מחפשים שאלות מתמטיות עם שרטוטים, תרשימים או שאלות הוכחה, המאגר הזה לא בשבילכם כי היוצרים זרקו אותן מראש כדי להקל על הבדיקה. אין פה מילה אחת בעברית, כל הטקסטים והמונחים הם באנגלית ובמקורות מתמטיים מסין. בנוסף, האימות של המתמטיקה נשען בעצמו על מודלי שפה, כך שייתכן שטעויות עקביות של אותם מודלים חמקו פנימה, ותחום התכנות מהווה פחות משישה אחוזים מסך כל הדאטה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לאימון מודל מסחרי?

כן, הרישיון המוגדר הוא MIT, שמאפשר שימוש מסחרי ללא מגבלות מיוחדות מלבד מתן קרדיט. עם זאת, מכיוון שחלק מהנתונים מגיעים מאתרים ומאגרים חיצוניים כמו Codeforces ו־APPS, יש לבדוק אם השימוש הסופי לא מתנגש עם זכויות המקור של תחרויות התכנות.

האם יש במאגר שאלות בעברית או תמיכה מקומית?

אין במאגר עברית כלל. כל התוכן הוא באנגלית, כשתחום המתמטיקה מבוסס במקור על תרגומי שאלות מסין ותחרויות בינלאומיות. אם המוצר שלכם מיועד לתלמידים בישראל, תצטרכו לתרגם את השאלות ולהתאים את הניסוחים לתוכנית הלימודים.

איך סוננו התשובות והאם אפשר לסמוך על הנכונות שלהן?

הסינון של תחום המתמטיקה בוצע על ידי מודלים חזקים כמו QwQ-32B ו־Qwen2.5-Math-72B בחמש הרצות נפרדות, כשרק שאלות עם פתרון עקבי נשמרו. שאלות אמריקאיות הומרו לשאלות פתוחות, ושאלות שדרשו שרטוטים או הוכחות נמחקו. בעיות התכנות לעומת זאת סוננו בעיקר מכפילויות ונשענות על מקרי בדיקה מקוריים.

מה היחס בין שאלות התכנות לשאלות המתמטיקה?

המאגר סובל מחוסר איזון כבד לטובת המתמטיקה. בפיצול האימון יש מעל 455 אלף שאלות מתמטיקה לעומת כ־25 אלף שאלות תכנות בלבד. אם המטרה העיקרית שלכם היא יצירת מודל פיתוח, תצטרכו להשלים נתונים ממקורות קוד נוספים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face בפקודת load_dataset רגילה עם הנתיב PRIME-RL/Eurus-2-RL-Data. אין צורך בבקשת גישה מיוחדת, הקבצים פתוחים להורדה בפורמט Parquet. השדה החשוב ביותר לעבודה הוא reward_model, שמכיל בתוכו את מקרי הבדיקה עבור בעיות קוד או את המחרוזת התקינה עבור מתמטיקה, והוא בנוי להתממשק ישירות עם מסגרות אימון תגמול כמו veRL.

from datasets import load_dataset

ds = load_dataset("PRIME-RL/Eurus-2-RL-Data")

הרישיון

הרישיון המדווח במאגר הוא MIT. אפשר להשתמש בנתונים לפרויקטים מחקריים ומסחריים, לשנות אותם ולשמור עליהם זכויות יוצרים, כל עוד כוללים את הצהרת הרישיון והקרדיט המקורי. השימוש בו אינו כופה פתיחת קוד של מודלים שתאמנו עליו, אך ראוי לוודא שאין תנאים סותרים ברישיונות של מאגרי המקור כמו APPS או Codeforces.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗