GPT
O

OpenR1-Math-Raw

קוד פתוח

open-r1apache-2.02025-02-12

מאגר ענק של בעיות מתמטיות עם שרשראות חשיבה שנכתבו על ידי מודל DeepSeek R1. החומר מתאים למי שרוצה לאמן מודלים על פתרון שלבים מורכבים במקום להסתפק רק בתשובה הסופית.

  • 4,280הורדות בחודש
  • 77לייקים

מה זה

המאגר מכיל 516,499 בעיות מתמטיות שמקורן בחלק הלא סינתטי של NuminaMath 1.5. לכל בעיה יש בין פתרון אחד לשמונה, ובסך הכל מעל 1.2 מיליון פתרונות שנוצרו על ידי DeepSeek R1, ממוצע של 2.3 פתרונות לבעיה.

הסינון הראשוני שמר רק פתרונות שנכנסים למגבלה של 16 אלף טוקנים ועוקבים אחרי תבנית החשיבה של תגיות think. בנוסף, המפתחים חילצו תשובות מחדש באמצעות Llama 3.3 70B Instruct לתוך עמודה ייעודית, ובדקו את נכונות התשובות בעזרת Math Verify ובודק שמבוסס על Llama. יש במאגר עמודת correctness שמציגה את תוצאות האימות האלה, כך שאפשר לראות אילו פתרונות נמצאו נכונים ובאיזה כלי.

מתאים ל

  • אימון מודלי חשיבה

    לימוד מודלים לייצר פתרונות מתמטיים ארוכים שכוללים שלבי מחשבה מפורטים.

  • מחקר על שגיאות הסקה

    ניתוח הבדלים בין פתרונות נכונים לשגויים שנפלטו מאותו המודל עבור אותה שאלה.

  • בניית מסנני אימות

    אימון ובדיקה של כלי שיפוט אוטומטיים שבודקים אם פתרון מתמטי מורכב הוא מדויק.

איפה זה נופל

זהו מאגר גולמי לחלוטין ולכן חלק ניכר מהפתרונות שגויים. מתוך כ־944 אלף פתרונות שנבדקו, רק כ־679 אלף או פחות אומתו כנכונים, תלוי בכלי הבדיקה. החומר כולו באנגלית, וכולל רק בעיות שהפתרון שלהן לא חרג מ־16 אלף טוקנים. אם אתם מחפשים חומר מוכן ומסונן היטב לאימון ישיר, המפתחים עצמם מפנים לגרסה המצומצמת יותר שלהם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר פורסם תחת רישיון Apache 2.0 שמתיר במפורש שימוש מסחרי. עליכם רק לשמור על תנאי הייחוס של הרישיון בעת הפצת הקוד או הנתונים.

האם המאגר כולל תוכן בעברית?

לא. המאגר מוגדר כולו באנגלית. כל השאלות ושרשראות החשיבה שנפלטו מהמודל כתובות בשפה זו בלבד.

מה ההבדל בין מאגר זה לגרסת 220k של אותו פרויקט?

מאגר זה מוגדר כ־Raw ומכיל את כל הפלטים הגולמיים, כולל פתרונות שגויים ומספר פתרונות לכל שאלה. גרסת ה־220k היא דגימה מסוננת ומנוקה יותר שמיועדת לאימון ישיר.

איך נאספו ואומתו הנתונים?

הבעיות נלקחו מהחלק הלא סינתטי של NuminaMath 1.5, ועבורן הופקו פתרונות דרך DeepSeek R1. האימות התבצע באמצעות Math Verify ובאמצעות מודל Llama 3.3 70B Instruct ששימש כשופט.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הנתיב open-r1/OpenR1-Math-Raw עם split שמוגדר כ־train. המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הנתונים מחולקים ל־40 קבצי parquet שונים בתיקיית המידע. בעבודה איתו חשוב לשים לב לעמודות של הפתרון, התשובות שחולצו מחדש ועמודת ה־correctness כדי לסנן שורות לפי אימות.

from datasets import load_dataset

ds = load_dataset("open-r1/OpenR1-Math-Raw")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן עליו מודלים חופשיים או מסחריים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗