GPT
U

UltraData-RL-2609

קוד פתוח

openbmbapache-2.02026-08-31

  • llm
  • reinforcement-learning
  • rlvr
  • verifiable-rewards
  • post-training

המאגר כולל 85,995 דוגמאות ללמידת חיזוק עם תגמול שניתן לאימות ממוחשב. הוא מתאים למי שרוצה לאמן מודלים על פתרון בעיות במתמטיקה, קוד, חשיבה מדעית והקשרים ארוכים.

  • 667הורדות בחודש
  • 69לייקים

מה זה

כל רשומה מורכבת מחמישה שדות קבועים: מזהה ייחודי, שאילתה מלאה, תשובת ייחוס, מקור ותחום. במשימות טקסטואליות השאילתה מציגה בעיה והתשובה היא מחרוזת קצרה לבדיקת התאמה, בעוד שבמשימות קוד התשובה מכילה מערכים של קלטים ופלטים להרצה. אין כאן שאלות רב-ברירה או שאלות שדורשות תמונות.

התוכן מחולק לארבעה תחומים: מתמטיקה עם 32,412 דוגמאות, קוד עם 23,665 בעיות, ניתוח מסמכים ארוכים עם 18,046 מקרים, ומדעים עם 11,872 פריטים. הנתונים הגיעו מאיחוד מקורות מוכרים כמו מאגרי DeepMath ו־OpenCodeReasoning, לצד הרחבות סינתטיות.

תהליך הסינון כלל הסרת פריטים ללא תשובה חד-משמעית, אימות עקביות באמצעות בדיקות מודלים מרובות, והרצת מבחני קוד בסביבה מבודדת. בנוסף בוצע כיול קושי מול מודל בסיס: שאלות קלות מדי שהמודל תמיד פתר נזרקו החוצה, כדי לספק אות אימון יעיל בלבד.

מתאים ל

  • אימון מודלים במתמטיקה

    אימון שלבי RL על בעיות חישוביות שמסתיימות בתשובה חד-משמעית הניתנת לאימות מהיר.

  • יצירת קוד עם בדיקות

    כוונון מודלים לכתיבת תוכניות באמצעות הרצת מקרי מבחן מקבילים לקלט ופלט רגילים.

  • הבנת הקשרים ארוכים

    תרגול מודלים בשליפת מידע ופתרון שאלות מורכבות על בסיס מסמכים רחבי היקף.

איפה זה נופל

המאגר תומך באנגלית ובסינית בלבד, ואין בו שום ייצוג לעברית. אם אתם רוצים לאמן על קוד, תצטרכו להקים סביבת הרצה ומנגנון בידוד בעצמכם, כי המאגר כולל רק מקרי מבחן ולא מנוע הרצה.

המשקולות וציוני הקושי ששימשו את החוקרים בזמן הבנייה לא נשמרו ברשומות. בנוסף, סינון הזליגה מול מבחני ביצועים נכון רק למה שהיה קיים עד תאריך הפרסום, כך שמבחנים חדשים יותר עלולים להכיל חפיפה שלא נוקתה.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

הרישיון המוצהר הוא Apache 2.0, אך היוצרים הוסיפו איסור מפורש על הפצה מחדש, שיקוף או אריזה מסחרית של הקבצים ללא רשות. אימון מודל אפשרי, אך חלקי המידע נשענים גם על רישיונות מקור כמו CC BY-SA 4.0.

האם הדאטהסט כולל שאלות ונתונים בעברית?

לא. המאגר מוגדר רשמית עבור אנגלית וסינית בלבד, וכל המקורות ששימשו לבנייתו הם בשפות אלו.

איך המאגר מוודא שהתשובות נכונות?

כל דוגמה עברה סינון קפדני לפי סוג התחום. במתמטיקה ומדעים נדרשה הסכמה בין כמה מודלים בלתי תלויים, בטקסט ארוך נבדק קשר ודאי למסמך, ובקוד הפתרונות ומקרי המבחן נבדקו בהרצה מעשית.

במה הוא שונה מסתם עוד מאגר שאלות ותשובות?

הוא נבנה במיוחד עבור למידת חיזוק, ולכן הוסרו ממנו שאלות אמריקאיות ושאלות קלות מדי שהמודל כבר פתר. המטרה היא לתת אות תגמול חד-משמעי שניתן לבדוק בלולאת אימון בלי צורך במעריך אנושי.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון המזהה openbmb/UltraData-RL-2609 ואחת מארבע התצורות: Math, Knowledge, Long-Context, או Code. הקבצים שמורים בפורמט JSONL ואין צורך באישור גישה מוקדם. השדה ground_truth קריטי לבניית פונקציית התגמול. במתמטיקה ומדעים מדובר במחרוזת פשוטה להשוואה, אבל בחלק של הקוד השדה מכיל מבנה נתונים עם מערכי inputs ו־outputs שדורש מכם להריץ את הקוד שהמודל יצר מול סביבת הרצה עצמאית.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraData-RL-2609")

הרישיון

המאגר מוגדר תחת רישיון Apache 2.0, אך כולל נתונים ממקורות שונים בעלי רישיונות כמו MIT, CC BY 4.0 ו־CC BY-SA 4.0 שממשיכים לחול. בנוסף, היוצרים אוסרים במפורש על העלאה מחדש, שיקוף או הפצה מסחרית ישירה של הקבצים ללא אישור בכתב. אימון מודלים מותר, אך שימוש ישיר בנתונים הנגזרים כפוף למגבלות אלו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗