GPT
O

OpenCodeReasoning-2

קוד פתוח

nvidiacc-by-4.02025-05-03

  • synthetic

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של פתרונות מנומקים וביקורת קוד שנבנה מתוך 34,799 שאלות תכנות תחרותי. הוא מיועד למי שרוצה לאמן מודלים לחשיבה מעמיקה, יצירת קוד וביקורת עמיתים בשפות פייתון וסי פלוס פלוס.

  • 7,951הורדות בחודש
  • 60לייקים

מה זה

המאגר מכיל מיליוני רשומות סינתטיות שנבנו סביב בעיות תכנות תחרותי מעשרה מקורות מובילים, כולל קודפורסס, ליטקוד, קודשף, אטקודר וקטיס. החלוקה המרכזית היא לפי שפות תכנות. יש כאן 1,398,166 דוגמאות בפייתון מתוך 34,125 שאלות, ועוד 1,174,475 דוגמאות בסי פלוס פלוס מתוך 30,092 שאלות. החלק של קודפורסס לבדו מרכיב את הנתח המשמעותי ביותר של הנתונים בכל שפה.

השאלות עצמן נאספו מתוך מאגרים קיימים כמו טאקו, אפס, קוד קונטסטס והפרויקט אופן אר אחת. המפתחים השמיטו בכוונה את קבוצות המבחן של חלק מהמקורות כדי למנוע דליפת מידע. עבור כל שאלה נוצרו שני סוגי פלטים סינתטיים. מודל אר אחת ייצר את הפתרון וההסבר המלא, ומודל קיו דבליו קיו ייצר ביקורת קוד מפורטת שכוללת הכרעה האם הפתרון נכון או שגוי, לצד אחוז מעבר של בדיקות יחידה.

במבנה הנתונים מקבלים עמודות נפרדות עבור הפלט המלא של המודלים, קטע הקוד הנקי בלבד, פסק הדין הבינארי ודירוג הקושי. בנוסף מתועדים שם המאגר המקורי, הרישיון המקורי שלו והפלטפורמה שממנה השאלה הגיעה.

מתאים ל

  • אימון מודל ליצירת קוד מנומק

    כוונון מודלים לכתיבת פתרונות אלגוריתמיים מורכבים בפייתון ובסי פלוס פלוס עם הסבר שלבי החשיבה.

  • פיתוח כלי לביקורת קוד

    אימון מערכות לאיתור שגיאות, מתן משוב מנומק על קוד ובדיקת תקינות של פתרונות תכנות.

  • מחקר על דאטה סינתטי

    בחינת ההשפעה של נתוני חשיבה שנוצרו על ידי אר אחת וקיו דבליו קיו על יכולות הניתוח של מודלים.

איפה זה נופל

יש פה מלכודת משמעותית. עמודת השאלה ריקה, כך שאי אפשר פשוט להוריד את המאגר ולהתחיל לאמן בלי להריץ תהליך מקדים של משיכת השאלות מהמקורות. הנתונים מוגבלים לשפות פייתון וסי פלוס פלוס בלבד. אין כאן שפות אחרות, אין תמיכה בעברית או במשימות שאינן תכנות תחרותי. כל הפתרונות והביקורות נוצרו בידי מודלים סינתטיים, וערכי בדיקות היחידה בחלק מהמקרים מחזירים מינוס אחת עקב היעדר יכולת בדיקה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מוגדר תחת רישיון חופשי שמתיר שימוש מסחרי. יחד עם זאת, מאחר שהשאלות מגיעות ממאגרים חיצוניים כמו טאקו או אפס, צריך לוודא שהרישיון של כל מקור ספציפי מתיר את השימוש שאתם מתכננים.

האם המאגר כולל טקסט בעברית?

לא. כל השאלות, קטעי הקוד, תהליכי ההסקה וביקורות הקוד מנוסחים באנגלית ובשפות התכנות פייתון וסי פלוס פלוס.

מדוע עמודת השאלה מופיעה כריקה?

היוצרים בחרו לא לכלול את הטקסט המקורי של השאלות בתוך הקבצים. כדי להשתמש בהן יש להשתמש בסקריפטים שמסופקים בריפו של נמו סקילס ולמשוך את השאלות ישירות ממאגרי המקור לפי המזהים.

מי יצר את התוכן במאגר?

השאלות נאספו מאתרי תחרויות כמו קודפורסס וליטקוד. הפתרונות ותהליכי ההסקה נוצרו באופן סינתטי על ידי המודל אר אחת, ודוחות הביקורת נוצרו על ידי המודל קיו דבליו קיו.

איך טוענים

הנתונים מחולקים על פני 131 קבצים בספריית הרכבת ומגיעים בפורמט פארקט. הגישה למאגר פתוחה לחלוטין ואינה דורשת אישור ידני או חתימה מקדימה. שימו לב שעמודת השאלה עצמה מושארת ריקה ברשומות, ומי שרוצה להשתמש בתוכן השאלה צריך למשוך אותו מהמאגרים המקוריים לפי שדות המזהה והאינדקס.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenCodeReasoning-2")

הרישיון

המאגר מופץ תחת רישיון סי סי בי וואי 4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן ייחוס הולם לאנבידיה. עם זאת, אנבידיה מבהירה שהשאלות עצמן כפופות לתנאי הרישיון של המקורות שמהם הן נאספו, ועל המשתמש לוודא שרישיונות המקור מתאימים למטרות האימון שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗