GPT
N

NextCoderDataset

קוד פתוח

microsoftmit2025-05-03

  • code
  • microsoft
  • nextcoder
  • selekt

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מאגר נתונים סינתטי מבית מיקרוסופט לאימון מודלים על עריכת קוד והוראות שינוי. הוא מיועד למי שרוצה ללמד מודל שפות לתקן או לשנות קוד קיים בשמונה שפות תכנות שונות.

  • 538הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל כ־381 אלף דוגמאות של הוראות ועריכות קוד, שמבוססות על 127 אלף דוגמאות ייחודיות שהוכפלו לשלוש וריאציות. הנתונים מכסים שמונה שפות תכנות פופולריות: פייתון, ג'אווה, סי, סי פלוס פלוס, ראסט, ג'אווהסקריפט, גו וקוטלין, כאשר לכל שפה יש בין 13,272 ל־17,337 רשומות ייחודיות.

המקור הראשוני לקוד הוא גרסה מסוננת מתוך StarCoderData. על גבי הדוגמאות האלה, החוקרים יצרו הוראות ותוצאות עריכה באופן סינתטי לחלוטין בעזרת המודלים GPT-4o ו־Llama-3.3-70B-Instruct. המבנה עצמו פשוט ומכיל שני שדות טקסט בלבד: prompt שכולל את ההוראה יחד עם קוד המקור, ו־completion שמחזיק את הקוד הערוך בהתאם לדרישה.

המאגר לא כולל חלוקה מובנית לסט בדיקה או מדדי הערכה, אלא מוגש כיחידה אחת שלמה שמיועדת לאימון. הוא פורסם לקראת כנס ICML לשנת 2025 כדי ללוות את שיטת האימון Selective Knowledge Transfer שפותחה עבור משפחת מודלי NextCoder.

מתאים ל

  • אימון עריכת קוד

    כוונון עדין של מודלי שפה כדי שיידעו לקבל קוד קיים והוראה, ולהחזיר את הגרסה הערוכה.

  • התאמה למספר שפות

    שיפור ביצועי מודל בשפות ספציפיות כמו ראסט, קוטלין או גו בעזרת אלפי דוגמאות ייעודיות לכל שפה.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של אימון על פלטים של מודלים חזקים כמו GPT-4o מול נתוני אמת של מתכנתים.

איפה זה נופל

כל הדאטהסט סינתטי לחלוטין, מה שאומר שההוראות והפתרונות נוצרו על ידי מודלים ולא על ידי מתכנתים בשר ודם. אם המודלים שיצרו את התוכן פספסו באגים עדינים או יצרו הנחיות מוזרות, זה נכנס ישירות למאגר. בנוסף, אין כאן בכלל שפות טבעיות מלבד אנגלית, כך שאין שום תמיכה בהוראות בעברית. היעדר סט מבחן רשמי אומר שתצטרכו להפריד נתונים בעצמכם או להביא בנצ'מרק חיצוני כדי לבדוק שהמודל שלכם באמת השתפר.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. ההוראות הטקסטואליות בשדה הפרומפט נכתבו באנגלית בלבד. אם המטרה היא לאמן מודל שיבין בקשות לשינוי קוד בעברית, תצטרכו לתרגם את הנתונים או להוסיף דוגמאות מקומיות משלכם.

מותר להשתמש בדאטהסט למוצר מסחרי?

הרישיון הרשמי בעמוד הוא MIT, שמאפשר שימוש מסחרי מלא. יחד עם זאת, הנתונים נוצרו בעזרת GPT-4o ו־StarCoderData, והחוקרים אף כתבו בהערות שעל המשתמש לוודא שהרישיון מתאים למטרותיו. שווה לבדוק את תנאי השימוש של אותם מודלים לפני שמשלבים במוצר סגור.

איך הדאטהסט נאסף ונבנה בפועל?

החוקרים לקחו קטעי קוד מתוך StarCoderData בשמונה שפות שונות, וסיננו אותם. לאחר מכן הם הפעילו את המודלים GPT-4o ו־Llama-3.3-70B-Instruct כדי לייצר באופן סינתטי את משימת העריכה ואת הקוד הסופי המתוקן.

האם יש חלוקה מוכנה לטריין וטסט?

לא, הכרטיס מציין במפורש שהמאגר אינו מכיל פיצול למבחן או בנצ'מרק. כל 381 אלף הדוגמאות מיועדות לאימון, ואם תרצו לבצע ולידציה תצטרכו להקצות חלק מהרשומות בצד לפני תחילת הריצה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face בלי צורך באישור גישה מיוחד, תחת המזהה microsoft/NextCoderDataset. הקבצים שמורים בפורמט Arrow ומחולקים לשישה חלקים ממוספרים, לצד קובץ המידע dataset_info.json. המבנה ברמת הקוד מינימלי, כך שכל רשומה דורשת רק חילוץ של שדה ה־prompt ושדה ה־completion.

from datasets import load_dataset

ds = load_dataset("microsoft/NextCoderDataset")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, כולל אימון מודלים ושינוי הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, היוצרים מדגישים שעל המשתמש לוודא בעצמו התאמה לצרכיו, בייחוד בהתחשב בכך שהנתונים נוצרו באמצעות מודלים מסחריים כמו GPT-4o והתבססו על StarCoderData.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗