GPT
O

OpenR1-Math-220k

קוד פתוח

open-r1apache-2.02025-02-10

המאגר מרכז 220 אלף שאלות מתמטיות שלכל אחת צורפו מסלולי חשיבה שיוצרו באמצעות DeepSeek R1. הוא מיועד למי שרוצה לאמן מודלים על פתרון בעיות מורכבות שלב אחר שלב.

  • 128,966הורדות בחודש
  • 788לייקים

מה זה

הנתונים מבוססים על בעיות מתוך NuminaMath 1.5, שעבורן הפיקו בין שניים לארבעה פתרונות מלאים בעזרת DeepSeek R1 ומנוע SGLang. תהליך הסינון כלל אימות של התשובות הסופיות, רובן נבדקו מול כלי הבדיקה Math Verify וכשנים עשר אחוזים מהן נבדקו באמצעות מודל שופט מסוג Llama-3.3-70B-Instruct. בכל רשומה שנכנסה למאגר יש לפחות מסלול חשיבה אחד שהגיע לתוצאה הנכונה.

המאגר מחולק לשני חלקים. החלק שנקרא default מכיל 94 אלף בעיות, ולפי בדיקות המפתחים הוא מביא לביצועים הטובים ביותר באימון. החלק השני, extended, כולל עוד 131 אלף דוגמאות ממקורות נוספים כמו cn_k12, אך המפתחים מציינים שהתוצאות מאימון עליו היו פחות טובות בגלל רמת קושי נמוכה יותר של השאלות.

מתאים ל

  • אימון SFT למודלי חשיבה

    לימוד מודלים לייצר פתרונות מתמטיים מפורטים בשיטת שרשרת מחשבה לפני הצגת התשובה.

  • אופטימיזציית העדפות ב־DPO

    שימוש במספר מסלולי פתרון לכל שאלה, נכונים ושגויים, כדי לאמן על העדפת הפתרון הנכון.

  • דגימת דחייה Rejection

    סינון ובחירת מסלולי החשיבה המוצלחים ביותר מתוך מספר פתרונות שנוצרו לכל שאלה.

איפה זה נופל

כל הנתונים באנגלית בלבד ואין במאגר עברית בכלל. בנוסף, מדובר בטקסט סינתטי שנוצר כולו על ידי מודל שפה, על כל ההטיות וסגנון הכתיבה שמאפיינים את DeepSeek R1. החלק המורחב מכיל שאלות ברמה נמוכה יותר שמורידות את איכות האימון, וחלק מהאימות הסתמך על מודל שפה כשופט ולא על בדיקה מתמטית דטרמיניסטית מוחלטת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן. הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. צריך רק לכלול את תנאי הרישיון ומתן הקרדיט הנדרש.

האם יש במאגר שאלות בעברית?

לא. כל השאלות ומסלולי ההסבר במאגר נכתבו באנגלית בלבד. אם רוצים להשתמש בו למודל בעברית, תצטרכו לתרגם את הנתונים.

באיזה חלק כדאי להשתמש, default או extended?

ברוב המקרים עדיף לבחור ב־default. יוצרי המאגר בדקו ומצאו שאימון עליו מניב ביצועים טובים יותר, מכיוון שחלק ה־extended כולל שאלות קלות יותר שמורידות מאיכות התוצאה.

איך וידאו שהפתרונות של המודל אכן נכונים?

השתמשו בכלי שנקרא Math Verify כדי לבדוק את התשובה הסופית במרבית הדוגמאות. בכ־12 אחוזים מהמקרים שבהם זה לא הספיק, נעזרו במודל Llama-3.3-70B-Instruct כשופט.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם המזהה open-r1/OpenR1-Math-220k. אין צורך באישור גישה מיוחד. המאגר מאוחסן בפורמט Parquet בחלוקה לקבצים, וצריך לציין בעת הטעינה אם מושכים את החלק של default או את extended. קחו בחשבון שמסלולי החשיבה ארוכים ומגיעים עד 16 אלף טוקנים לפתרון, כך שנפח הטקסט והעיבוד בזיכרון משמעותיים.

from datasets import load_dataset

ds = load_dataset("open-r1/OpenR1-Math-220k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים לכל מטרה. התנאי העיקרי הוא מתן ייחוס מתאים ליוצרים ושמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לשתף פיתוחים עתידיים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗