GPT
D

DAPO-Math-17k-Processed

קוד פתוח

open-r1רישיון לא דווח2025-04-10

המאגר מרכז שאלות מתמטיקה שעברו ניקוי כפילויות והתאמה ישירה לפורמט של מאמן ה־GRPO מבית TRL. הוא חוסך עבודת עיבוד ידנית למי שמאמן מודלים של הסקת מסקנות.

  • 6,580הורדות בחודש
  • 85לייקים

מה זה

הנתונים מבוססים על המאגר DAPO-Math-17k של BytedTsinghua-SIA. הצוות של open-r1 לקח את הנתונים הגולמיים, ניקה פרומפטים כפולים, ועיצב מחדש את השאלות ותשובות האמת כדי שיתאימו ישירות ל־GRPO trainer של ספריית TRL. כל לוגיקת העיבוד הזו חשופה בסקריפט create_dataset.py שנמצא במאגר.

התוכן מחולק לתת-מאגרים לפי שפה. יש גרסה מלאה שנקראת all, ולצידה פוצלו שני סטים נפרדים, אחד באנגלית טהורה תחת en והשני בסינית תחת cn. כל חלק שמור כקובץ פרקט יחיד של סט אימון, כך שאין כאן חלוקה מובנית לסט בדיקה או ולידציה.

מתאים ל

  • אימון GRPO עם TRL

    חיבור ישיר למאמן החיזוק של TRL בלי לבזבז זמן על התאמת שדות הפרומפט ותשובת האמת.

  • הסקה מתמטית באנגלית

    שימוש בתת-המאגר en לשיפור יכולות פתרון תרגילים וחישוב צעד-אחר-צעד במודלים פתוחים.

  • אימון מודלים דו-לשוניים

    שילוב נתוני המתמטיקה בסינית ובאנגלית לבדיקת ביצועי הסקה חוצי שפות.

איפה זה נופל

המאגר מוגבל אך ורק לאנגלית ולסינית, ואין בו שום תמיכה בעברית. הכרטיס לא מפרט אילו סוגי בעיות מתמטיות נכללים, מה רמת הקושי או מה שיעור השגיאות בתשובות האמת שמקורן בדאטה המקורי. בנוסף, אין כאן פיצול רשמי לסט מבחן, כך שתצטרכו להפריד נתונים בעצמכם כדי למנוע דליפת מידע בזמן בדיקת המודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כדאי. המפרסמים לא ציינו שום רישיון בכרטיס המאגר. ללא רישיון שימוש מפורש, אין היתר חוקי להשתמש במידע, במיוחד לא ליישומים מסחריים.

האם יש במאגר שאלות בעברית?

לא. הנתונים פוצלו לשתי שפות בלבד, אנגלית וסינית. אין כאן תרגום או ייצוג לשפות אחרות.

איך המאגר הזה שונה מהמקור של DAPO-Math-17k?

הגרסה הזו עברה סינון והסרה של פרומפטים כפולים. בנוסף, המבנה של השאלות והתשובות הותאם לפורמט הדרוש עבור GRPO trainer, וחולק לתת-קבוצות נקיות לפי שפה.

האם יש חלוקה מובנית לסט אימון וסט בדיקה?

לא. הקבצים במאגר מוגדרים כולם כקובצי train בלבד. אם אתם רוצים להעריך ביצועים, תצטרכו לחתוך חלק מהדאטה בעצמכם לפני תחילת הריצה.

איך טוענים

אתם מושכים את הקבצים ישירות דרך ספריית datasets עם המזהה open-r1/DAPO-Math-17k-Processed. אין צורך לבקש אישור גישה, המאגר פתוח לחלוטין. הנתונים מגיעים בפורמט parquet ומחולקים לשלוש תצורות: all, en ו־cn. שדות הפרומפט והתשובות ערוכים מראש למבנה שמצפה לקבל מאמן ה־GRPO של TRL, כך שאפשר לחבר אותו ישירות לריצת אימון חיזוק בלי סקריפטים מקדימים לניקוי טקסט.

from datasets import load_dataset

ds = load_dataset("open-r1/DAPO-Math-17k-Processed")

הרישיון

היוצרים לא הגדירו רישיון במאגר. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות ושאין לכם היתר מפורש להשתמש בנתונים, לא לפרויקטים מסחריים ואפילו לא לאימון מודל מחקרי. אם אתם בונים מוצר לחברה, השימוש בו מסוכן עד שהמפרסמים יעדכנו רישיון ברור.

הרישיון המלא ב־Hugging Face ↗