GPT
O

OpenCodeReasoning

קוד פתוח

nvidiacc-by-4.02025-04-01

  • synthetic

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של שאלות תכנות תחרותי מפלטפורמות שונות עם פתרונות מנומקים של R1 בפייתון. הוא מיועד למי שרוצה לאמן מודלים על שרשראות חשיבה אלגוריתמיות עמוקות.

  • 19,253הורדות בחודש
  • 557לייקים

מה זה

המאגר מכיל 735,255 דוגמאות בפורמט פייתון, שנבנו מתוך 28,319 שאלות תכנות תחרותי שונות. השאלות נאספו ממאגרים קיימים כמו TACO, APPS, CodeContests ופרויקט open-r1/codeforces, שמקורם באתרים מוכרים כמו CodeForces, AtCoder, LeetCode ואחרים. היוצרים החריגו את חלקי הבדיקה של CodeContests ו־open-r1/codeforces כדי למנוע זליגת נתונים להערכה.

כל רשומה כוללת מזהה ייחודי, מקור הנתונים, רמת הקושי, רישיון המקור, את שרשרת ההסקה המלאה שייצר המודל R1 ואת קוד הפתרון הסופי בלבד. החלוקה הפנימית מורכבת: ב־split_0 שדה השאלה מופיע ישירות בתוך הטקסט, בעוד שב־split_1 הטקסט של השאלה עצמה אינו מצורף, ויש למשוך אותו עצמאית לפי שדות המזהה והאינדקס ממאגרי המקור.

מתאים ל

  • אימון מודלי הסקה לקוד

    כוונון עדין מונחה על שרשראות חשיבה ארוכות שנבנו על ידי R1 לפתרון בעיות.

  • בניית מודלי תכנות תחרותי

    אימון על עשרות אלפי בעיות אלגוריתמיות מגוונות מפלטפורמות כמו CodeForces.

  • סינון והערכת פתרונות

    הפרדה בין שרשרת ההסקה המלאה לבין בלוק הקוד הסופי באמצעות שדה הפתרון הנפרד.

איפה זה נופל

התשובות כולן סינתטיות ונוצרו על ידי R1, מה שאומר שהן עלולות להכיל שגיאות הסקה או הזיות קוד עדינות שלא נתפסו. כל הקוד מוגבל לשפת פייתון בלבד, והשאלות כתובות באנגלית של תחרויות קוד ולא מייצגות פיתוח תוכנה יומיומי של מערכות פרודקשן. מעבר לכך, חלק משמעותי מהשאלות ב־split_1 דורש שחזור חיצוני, מה שמסבך את תהליך ההכנה לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודלים מסחריים?

הרישיון הראשי הוא cc-by-4.0 ואינו מגביל שימוש מסחרי. עם זאת, היוצרים מדגישים שחלק מהשאלות הגיעו ממאגרי מקור ברישיונות שונים. עליכם לבדוק את שדה הרישיון ברשומות הספציפיות שאתם כוללים באימון.

האם המאגר כולל תמיכה בשפות תכנות נוספות או בעברית?

הנתונים כוללים אך ורק פתרונות שנכתבו בשפת פייתון. כל השאלות ושרשראות החשיבה מנוסחות באנגלית טכנית מעולם התכנות התחרותי. אין במאגר טקסט בעברית.

איך נאספו התשובות והאם מדובר בפתרונות שנבדקו על ידי בני אדם?

השאלות נאספו ממאגרים קיימים כמו TACO ו־APPS שמרכזים אתרי תחרויות. הפלטים וההסברים נוצרו באופן סינתטי וממוכן לחלוטין באמצעות המודל R1. לא נעשה סינון אנושי ידני לכל דוגמה.

למה הטקסט של חלק מהשאלות חסר בתוך הקבצים?

בחלוקה שנקראת split_1 השאלות עצמן לא מופיעות בטקסט כדי לעמוד במגבלות הפצה. המאגר מספק במקומן שדות מזהה, אינדקס ומקור. תצטרכו להוריד את מאגרי הבסיס בנפרד ולמזג את השאלות לפי המפתחות האלה.

איך טוענים

טוענים את הנתונים ישירות מספריית datasets של Hugging Face ללא צורך באישור גישה מראש. המאגר כולל 42 קבצים, מתוכם קובצי Parquet מחולקים, כמו שלושים קבצים שונים עבור split_0 בלבד. בעבודה שוטפת כדאי לשים לב לשדות input, output ו־solution, ולזכור ששימוש בחלק split_1 ידרוש מכם קוד טעינה נוסף שימשוך את השאלות מ־APPS או TACO.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenCodeReasoning")

הרישיון

המאגר מפורסם ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט מתאים. עם זאת, היוצרים מבהירים שכל מקור נתונים פנימי שומר על רישיונו המקורי, כך שעליכם לבדוק את שדה הרישיון בכל רשומה כדי לוודא שאינו מגביל שימוש מסחרי במודל הסופי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗