GPT
O

OpenCodeInstruct

קוד פתוח

nvidiacc-by-4.02025-04-09

  • code
  • synthetic

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של חמישה מיליון צמדי שאלות ותשובות קוד לאימון מודלים מונחה הוראות. הוא מושך בזכות היקף עצום ובדיקות יחידה מובנות להערכת איכות התוצאות.

  • 35,948הורדות בחודש
  • 109לייקים

מה זה

המאגר כולל חמישה מיליון רשומות המיועדות לשלב הכוונון העדין. כל דוגמה מורכבת משאלת תכנות ומתשובה שנוצרה על ידי מודל שפה, לצד מטא-דאטה עשיר. הנתונים מחולקים לתחום גנרי ותחום אלגוריתמי, ונוצרו בשיטות היברידיות אוטומטיות וסינתטיות תוך שימוש באלגוריתמים מסוג self-instruct ו־evol-instruct בין ינואר למרץ 2025.

המבנה של כל רשומה כולל מזהה ייחודי, שאלת הקלט, תשובת המודל, והגדרה של התחום ושיטת היצירה. החלק המעניין באמת נמצא במנגנון הסינון והאימות: כל רשומה מכילה שדה עם הערכת מודל שפה לפי מספר קריטריונים, רשימה של בדיקות יחידה, פירוט סטטוס ההרצה של כל בדיקה כעובר או נכשל, וציון ממוצע שמציג את שבריר הבדיקות שעברו בהצלחה.

מתאים ל

  • אימון הוראות לקוד

    כוונון עדין של מודלי שפה פתוחים על כמות גדולה של משימות תכנות סינתטיות.

  • סינון לפי בדיקות יחידה

    בניית תתי מאגרים איכותיים על ידי שליפת דוגמאות שעברו את כל בדיקות ההרצה.

  • השוואת שיטות יצירה

    חקר ההבדלים בביצועים בין evol-instruct לבין self-instruct על משימות פיתוח.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מודלים, כך שאתם מסתכנים בהזיות או שגיאות עדינות שנראות משכנעות. הטקסט כולו באנגלית בלבד, ואין כאן שום ייצוג לשפות אחרות או למשימות קוד שמלוות בעברית. בנוסף, חלוקת התחומים מוגבלת לקוד גנרי ואלגוריתמי בלבד, מה שאומר שחסרים הקשרים של מערכות תוכנה גדולות ומורכבות מהעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא CC BY 4.0 והכרטיס מציין במפורש שהדאטה מתאים לשימוש מסחרי ולא מסחרי. החובה היחידה שלכם היא לתת ייחוס הולם ל־NVIDIA.

כמה שטח אחסון צריך כדי להוריד את הנתונים?

נפח ההורדה עומד על 6.4 גיגה-בייט. המידע מחולק ל־50 קובצי parquet שונים בתוך הפיצול של נתוני האימון.

האם יש במאגר הוראות או שאלות בעברית?

לא, הדאטהסט מתועד באנגלית בלבד. כל שאלות התכנות והתשובות מנוסחות באנגלית ואין בו שפות נוספות.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הנתונים לא נלקחו ממאגרי קוד קיימים של מתכנתים אנושיים אלא נוצרו באופן סינתטי ואוטומטי לחלוטין. NVIDIA ייצרה אותם בין ינואר למרץ 2025 בעזרת מודלי שפה.

איך טוענים

טוענים את הדאטה ישירות דרך ספריית datasets באמצעות פקודת load_dataset רגילה עם פיצול train. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. נפח ההורדה עומד על 6.4 גיגה-בייט והמידע מחולק לחמישים קובצי parquet. שדות המפתח שחובה לסנן לפיהם לפני שמתחילים להריץ אימון הם average_test_score ו־tests_execution_status, כדי שלא תאמנו על תשובות שכשלו בבדיקות.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenCodeInstruct")

הרישיון

הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי ומחקר חופשי, בתנאי שאתם נותנים קרדיט מתאים למפתחים. אין דרישה לשתף את המודל שלכם באותו רישיון, ומבחינה משפטית מותר לאמן עליו מודלים מסחריים בלי לחשוף את המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗