GPT
K

KodCode-V1

קוד פתוח

KodCodecc-by-nc-4.02025-02-28

  • code

מאגר סינתטי רחב לאימון מודלי קוד שמכיל שאלות, פתרונות ובדיקות יחידה מובנות. הוא נבנה במיוחד עבור למידת חיזוק ומספק מנגנון אימות עצמי לכל פתרון.

  • 8,207הורדות בחודש
  • 115לייקים

מה זה

הנתונים כוללים מאות אלפי רשומות המחולקות ל־12 תתי-מאגרים שונים, שמכסים תרגילי תכנות בסיסיים, שאלות בסגנון ליטקוד ותחרויות קוד, מבני נתונים ותיעוד טכני. כל רשומה כוללת שאלה סינתטית, פתרון שנכתב על ידי המודל gpt-4o-0513, ובדיקות יחידה תואמות בפורמט Pytest או קלט ופלט סטנדרטיים.

הפתרונות והבדיקות עברו תהליך אימות עצמי של עד עשר הרצות, כדי לוודא שהקוד אכן עובר את הטסטים שנכתבו עבורו. הרשומות כוללות גם מידע על אחוזי המעבר של המודל, רמת הקושי שנגזרה מהם, נתוני כיסוי של הבדיקות, וחישוב דמיון קוסינוס לבנצ'מרקים מוכרים בתחום כמו HumanEval ו־LiveCodeBench כדי לאתר חפיפות.

מתאים ל

  • אימון בלמידת חיזוק

    אימון מודלים לייצור קוד עם משוב מבוסס בדיקות יחידה קיימות.

  • אימון מונחה למודלי קוד

    כוונון עדין של מודלי שפה על שאלות תכנות מגוונות באנגלית.

  • הערכת יכולות פתרון בעיות

    בדיקת ביצועים של מודלים מול בעיות אלגוריתמיות ברמות קושי שונות.

איפה זה נופל

כל הנתונים נוצרו בצורה סינתטית על ידי מודל יחיד, מה שמייצר תלות מוחלטת באיכות ובדפוסים של gpt-4o-0513. התוכן קיים באנגלית בלבד, ואין כאן נתונים בעברית. שאלות שמסומנות תחת use_with_caution כוללות שדה שמפרט מדוע הן סוננו, כך שחובה לסנן את המאגר לפי השדות האלה ולא לטעון אותו בצורה עיוורת ישר לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, שמגביל את השימוש למטרות לא מסחריות בלבד. כל שימוש עסקי או מכירה של מודל שאומן עליו אסורים.

האם יש במאגר שאלות או קוד בעברית?

לא, המאגר כולו מוגדר באנגלית. כל השאלות, ההסברים, התיעוד והבדיקות נוצרו בשפה האנגלית בלבד.

איך נאספו ונוצרו הנתונים?

הנתונים הם סינתטיים לחלוטין. השאלות, הפתרונות ובדיקות היחידה נוצרו על ידי gpt-4o-0513, ונבדקו בלולאת הרצה של עד עשר פעמים כדי לאמת שהפתרון עובר את הבדיקות.

מה ההבדל בין גרסת הבסיס הזו לגרסאות האחרות של המאגר?

גרסה זו מיועדת ספציפית ללמידת חיזוק ומכילה מטריקות הרצה ובדיקות יחידה לאימות. קיימות גרסאות נפרדות ברשת שמיועדות מראש לכוונון עדין ישיר.

איך טוענים

המאגר זמין להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מיוחד, ומחולק ל־16 קובצי parquet בתיקיית המידע. הרשומות מחזיקות שדות מפתח כמו question, solution, ו־test, לצד שדה test_info שמכיל חתימות פונקציה ותיעוד. אם אתם מאמנים מודל בלמידת חיזוק, המפרסמים ממליצים להזין את המידע מתוך test_info ישירות לתוך הפרומפט. מחרוזות הבדיקות דורשות לעיתים המרה למבנה נתונים באמצעות ast.literal_eval.

from datasets import load_dataset

ds = load_dataset("KodCode/KodCode-V1")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0, שאינו מתיר שימוש מסחרי מכל סוג שהוא. מותר להשתמש במידע למטרות מחקר, לימוד וניסויים אישיים בלבד, תוך מתן קרדיט מתאים ליוצרים. מודל שתאמנו על הדאטהסט הזה לא יוכל לשמש במוצר מסחרי או להימכר כשירות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗