GPT
K

KodCode-V1-SFT-R1

קוד פתוח

KodCodecc-by-nc-4.02025-03-01

  • code

מאגר סינתטי לאימון מודלי קוד בשיטת SFT שמציע שאלות תכנות, טסטים לאימות ותשובות שנבדקו הרצה. הוא מתאים למי שרוצה דאטה שעבר סינון קפדני לפי בדיקות יחידה ולא רק טקסט גולמי.

  • 11,992הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל בין מאה אלף למיליון רשומות שמיועדות לאימון מודלים על מענה לשאלות קוד. הבסיס נלקח מתוך KodCode-V1, והתשובות הופקו באמצעות DeepSeek R1. כדי להבטיח את איכות הפתרונות, המפתחים ייצרו שלוש תשובות שונות לכל שאלה וביצעו סינון דחייה מבוסס בדיקות הרצה, כך שכל התשובות שנשמרו אומתו מול טסטים ייעודיים שנבנו מראש על ידי gpt-4o-0513.

התוכן מחולק ל־12 תתי קבוצות שונות שמכסות רמות קושי ותחומים מגוונים. בין החלקים תמצאו 43 אלף שאלות פשוטות בקבוצת Prefill, מבחני קוד ואלגוריתמים כמו Leetcode עם 27 אלף שאלות, Codeforces עם 33 אלף, Apps עם 21 אלף, Taco עם 81 אלף, ו־Code Contests עם 36 אלף. בנוסף נכללים מבני נתונים ואלגוריתמים, תיעוד טכני עם 43 אלף שאלות, וכן תת קבוצות כמו Filter, Package ו־Evol.

כל רשומה מגיעה באחד משלושה סגנונות עיקריים: שאלות שפה טבעית, חתימות פונקציה עם דוגמאות בדיקה, או פורמט של שופט מקוון מבוסס קלט ופלט סטנדרטיים. הנתונים כוללים את השאלה, פתרון ה־R1 המאומת, בדיקות יחידה בפורמט Pytest או קלט פלט, ומדדי הצלחה של המודל במספר ניסיונות.

מתאים ל

  • אימון SFT למודלי קוד

    כוונון עדין של מודלי שפה על שאלות תכנות עם פתרונות שנבדקו מול טסטים בפועל.

  • הערכת ביצועי מודלים

    בדיקת יכולות כתיבת קוד של מודל קיים מול מאגר טסטים מגוון ברמות קושי שונות.

  • מחקר על דחיית דגימות

    ניתוח הצלחות וכישלונות של פתרונות מודל לפי נתוני המעבר בטסטים שמצורפים לכל שאלה.

איפה זה נופל

כל הנתונים במאגר נוצרו באופן סינתטי לחלוטין על ידי מודלי שפה, ולכן הם עלולים להכיל שגיאות תכנותיות סמויות שהטסטים המקוריים שנוצרו במקביל לא הצליחו לזהות. המאגר מוגדר כמאגר באנגלית בלבד, ואין בו שום תמיכה בשפות אחרות או בהקשרים מקומיים.

בנוסף, מאחר שקיימים קבצים המכילים תשובות שגויות לצד הנכונות, חובה לוודא לפני תחילת האימון שאתם טוענים רק את הרשומות שעברו אימות ולא נתונים מקובצי ה־incorrect. מודל שאומן אך ורק על בעיות תחרותיות ותרגילי אלגוריתמים יתקשה מאוד במשימות של ארכיטקטורת תוכנה או פרויקטים רחבים בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. המאגר מפורסם תחת רישיון CC BY-NC 4.0 שמונע כל שימוש מסחרי. מותר להשתמש בו למטרות מחקר, לימוד ובדיקות פנימיות שאינן מסחריות בלבד.

האם יש במאגר תוכן או תמיכה בעברית?

לא. המאגר מוגדר רשמית באנגלית בלבד, וכל שאלות התכנות, התיעוד והקוד כתובים באנגלית.

איך נאספו ואומתו התשובות במאגר?

השאלות נלקחו מ־KodCode-V1, והתשובות הופקו באמצעות DeepSeek R1 בשלושה ניסיונות לכל שאלה. רק תשובה שעברה בהצלחה את בדיקות היחידה שנבנו מראש הוגדרה כמאומתת ונשמרה לשימוש.

מה ההבדל בין המאגר הזה לגרסאות האחרות של KodCode?

גרסה זו מיועדת ספציפית ל־SFT ומכילה תשובות שנוצרו על ידי DeepSeek R1 ואומתו בטסטים. זאת בניגוד לגרסת הבסיס המיועדת ל־RL או גרסת SFT מקבילה שמבוססת על תשובות של gpt-4o.

איך טוענים

טוענים את המאגר ישירות דרך Hugging Face ללא צורך בהרשאת גישה מיוחדת, כאשר הנתונים מחולקים על פני 25 קבצים וביניהם קובצי Parquet שונים. כדאי לשים לב שקיימים קבצים שמכילים תשובות שלא עברו בדיקה תחת השם incorrect.

השדות המרכזיים לעבודה בסיסית הם conversation שכולל את השאלה והתשובה המאומתת של R1, וכן השדות question, r1_solution ו־test שמכיל את בדיקות היחידה. כדי להמיר את הטסטים למבנה נתונים שימושי בקוד, יש להמיר את המחרוזת באמצעות ast.literal_eval.

from datasets import load_dataset

ds = load_dataset("KodCode/KodCode-V1-SFT-R1")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC 4.0. הרישיון מתיר שימוש חופשי לצורכי מחקר ולמידה בלבד, ומחייב מתן קרדיט ליוצרים. חל איסור מוחלט על שימוש מסחרי, מה שאומר שאסור לשלב אותו במוצר עסקי או לאמן עליו מודלים שמיועדים לשירות בתשלום או לשימוש מסחרי פנימי בחברה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗