GPT
G

guru-RL-92k

קוד פתוח

IFMmit2025-06-03

המאגר מרכז קרוב ל־92 אלף דוגמאות מנופות לאימון למידת חיזוק על שישה תחומי חשיבה שונים. הוא מתאים למי שרוצה לבנות מודל מנמק עם יכולת אימות אוטומטית של התשובות.

  • 3,484הורדות בחודש
  • 48לייקים

מה זה

הנתונים מחולקים לשישה תחומים שנועדו לבחון יכולות חשיבה מעמיקות: מתמטיקה, כתיבת קוד, מדעים, לוגיקה, סימולציית ריצת קוד והבנת טבלאות. המתמטיקה מהווה את החלק הארי עם 54.4 אלף רשומות שמגיעות ממאגרים כמו Skywork-OR1, DAPO ו־DeepScaler. הקוד תופס 18.1 אלף שאלות שמקורן באתגרים מוכרים כמו LeetCode, TACO ו־LiveCodeBench. שאר התחומים קטנים בהרבה ונעים סביב אלפים בודדים של דוגמאות, כולל חידות היגיון, אתגרי ARC-AGI וניתוח טבלאות מורכבות.

היוצרים אספו במקור כ־684 אלף דוגמאות גולמיות והעבירו אותן סינון קפדני בן חמישה שלבים. הסינון כלל הסרת כפילויות, בדיקות איכות היוריסטיות וכיול רמת הקושי על בסיס ביצועים בפועל. כל רשומה במאגר מגיעה כמבנה שיחה סטנדרטי לצד שדות שמפרטים את מקור הדאטה, התחום הנבדק, ושיעורי ההצלחה שנמדדו על המודלים Qwen 2.5-7B ו־Qwen 3-30B. בנוסף מצורף שדה ייעודי עם נתוני אמת שמאפשר לחשב תגמול מדויק בזמן אימון RL.

מתאים ל

  • אימון RL למודלי שפה

    אימון ישיר של אלגוריתמי חיזוק בעזרת נתוני אמת מובנים שמאפשרים לתת ציון מדויק לתשובות המודל.

  • כיול מודלים לפי קושי

    סינון ומיקוד נתוני אימון על בסיס שיעורי ההצלחה שנמדדו מראש על גדלים שונים של מודלי Qwen.

  • בנצ'מרק רוחבי לחשיבה

    בדיקת יכולות הסקת מסקנות בלוגיקה, קוד, טבלאות ומתמטיקה מול התיקיות המוכנות של offline_eval.

איפה זה נופל

למרות ההבטחה לכיסוי רחב, החלוקה לא מאוזנת בעליל. מתמטיקה וקוד מרכיבות כמעט שמונים אחוז מכלל הדוגמאות, בעוד שמדעים וסימולציה נשארות עם פחות מארבעת אלפים שאלות כל אחת. הנתונים ממוקדים באנגלית בלבד ובתחומים מוגדרים מאוד עם תשובה חד משמעית. אין כאן מענה לתרחישים רב לשוניים, אין ייצוג לעברית, והחומר אינו משקף שפה טבעית יומיומית או שיח חופשי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר במאגר הוא MIT ומאפשר שימוש מסחרי חופשי לחלוטין. עם זאת, הדאטהסט מרכז בתוכו נתונים ממאגרים חיצוניים כמו LeetCode ו־ARC. כדאי לוודא שאימון מודל על דאטה מאותם מקורות ספציפיים תואם את מדיניות החברה שלכם.

האם המאגר כולל דוגמאות בעברית?

לא, הדאטהסט כולו מבוסס על אנגלית ותחביר טכני. השאלות במתמטיקה, הקוד, המדעים והטבלאות נאספו כולם ממקורות בינלאומיים באנגלית. אם המטרה היא שיפור יכולות נימוק בשפה העברית, תצטרכו לתרגם את הפרומפטים או לאמן מודל בסיס חזק בעברית תחילה.

איך נאספו וסוננו הנתונים בדאטהסט?

היוצרים התחילו עם מאגר ענק של כ־684 אלף דוגמאות מ־14 מקורות שונים ברשת. הם העבירו את כל החומר צינור עיבוד של חמישה שלבים שכלל ניקוי כפילויות, סינון היוריסטי של איכות ובדיקת שיעורי מעבר על מודלים. בסיום התהליך נשארו 91.9 אלף דוגמאות שבהן התשובות ניתנות לאימות אוטומטי אמין.

מה היתרון שלו על פני סטים רגילים של שאלות ותשובות?

הוא נבנה מהיסוד עבור reinforcement learning ומכיל מנגנוני אימות לתשובות נכונות. במקום רק טקסט סופי, כל רשומה כוללת מטא-דאטה על רמת הקושי ושדה ייעודי לחישוב תגמול. בנוסף, הוא מאגד שישה תחומי חשיבה תחת סכמה אחת במקום לאלץ איסוף מפוזר.

איך טוענים

המאגר פתוח לגישה ישירה בפורמט Parquet, כך שאפשר להוריד ולטעון אותו מיידית בספריית datasets הרגילה של פייתון בלי להמתין לאישורים. יש בו 49 קבצים הכוללים גם סטים להערכה חיצונית כמו HumanEval, LiveCodeBench, MBPP ו־AIME. בזמן בניית התהליך, חשוב לשים לב לשדות reward_model ו־extra_info שמכילים את המבנה הייעודי לחישוב התגמול. המבנה הפנימי של השדות האלה משתנה בהתאם למשימה, ולכן תצטרכו להתאים את פונקציית הבדיקה לכל תחום בנפרד.

from datasets import load_dataset

ds = load_dataset("IFM/guru-RL-92k")

הרישיון

המאגר מופץ ברישיון MIT, מה שנותן חופש פעולה מלא לשימוש אישי ומסחרי. אפשר לאמן עליו מודלים, לשנות את הנתונים ולשלב אותם בכל מוצר, בתנאי ששומרים על הודעת זכויות היוצרים של היוצרים. המודלים שתאמנו לא מחויבים ברישיון פתוח, אבל מומלץ לוודא שהרישיונות של מקורות המקור, כמו שאלות מ־LeetCode, לא סותרים את השימוש שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗