GPT
D

DeepCoder-Preview-Dataset

קוד פתוח

agentica-orgmit2025-04-07

  • code

המאגר מרכז עשרות אלפי בעיות תכנות תחרותי יחד עם מקרי בדיקה לאימות אוטומטי. הוא נבנה עבור אימון והערכה של מודלי קוד שחייבים לספק פתרונות שרצים ונבדקים בפועל.

  • 5,798הורדות בחודש
  • 115לייקים

מה זה

הנתונים מחולקים לחלק של אימון וחלק של בדיקה. סט האימון כולל 24K בעיות שמגיעות מכמה מקורות: 7.5K בעיות מתוך TACO Verified, עוד 16K בעיות קוד מאומתות מתוך SYNTHETIC-1 של PrimeIntellect, וכן 600 בעיות מתוך LiveCodeBench גרסה 5 שהוגשו בין ה־1 במאי 2023 ל־31 ביולי 2024.

סט הבדיקה נשען על בעיות מאוחרות יותר של LiveCodeBench מאוגוסט 2024 עד פברואר 2025, לצד בעיות Codeforces שנלקחו מתוך Qwen/CodeElo. בכל שורה יש את תיאור הבעיה שנאסף בעיקר מאתרי תכנות תחרותי, ולצידו מערך בדיקות. הצוות סינן את החומר כך שכל בעיה ניתנת לאימות מלא ומכילה לפחות 5 מקרי בדיקה.

מתאים ל

  • אימון מודלי קוד

    לימוד מודלים לפתרון בעיות אלגוריתמיות בעזרת דוגמאות שמכילות מקרי בדיקה מלאים.

  • בדיקת אימות פתרונות

    הרצת קוד שנוצר מול לפחות 5 מקרי בדיקה לכל בעיה כדי למדוד דיוק אמיתי.

  • הערכת ביצועים בבנצ'מרק

    בחינת מודלים על בעיות עדכניות מתוך LiveCodeBench ו־Codeforces.

איפה זה נופל

כל הטקסטים והקוד כתובים באנגלית, ללא תמיכה בשפות אחרות כמו עברית. המיקוד מוגבל לתכנות תחרותי קלאסי עם קלטים ופלטים מוגדרים, כך שזה לא משקף פיתוח מערכות אמיתיות, ארכיטקטורה או עבודה עם ספריות חיצוניות מורכבות. בנוסף, חלקי המידע השונים כוללים מפתחות לא אחידים מעבר לשדות הבסיס, מה שמחייב ניקוי והתאמה לפני אימון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא mit. הרישיון הזה מתיר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים, ובלבד שמצרפים את הצהרת הרישיון והקרדיט המקוריים.

האם יש בנתונים בעיות או הסברים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל בעיות התכנות ומקרי הבדיקה נאספו מפלטפורמות בינלאומיות באנגלית.

מה מייחד את מקרי הבדיקה במאגר הזה?

היוצרים וידאו שכל בעיה ניתנת להרצה ולאימות מלא. בנוסף נקבע סף מינימלי של לפחות 5 מקרי בדיקה לכל רשומת בעיה.

מה כולל סט המבחן של הדאטהסט?

סט המבחן כולל בעיות מ־LiveCodeBench מהתקופה שבין אוגוסט 2024 לפברואר 2025. בנוסף הוא מכיל בעיות Codeforces שנלקחו מתוך המאגר Qwen/CodeElo.

איך טוענים

הקובץ מחולק ל־31 קבצים בסך הכל, בתצורת parquet לפי חלוקות כמו lcbv5 ו־codeforces. אפשר לטעון אותו ישירות דרך ספריית datasets בלי צורך בבקשת גישה מיוחדת או אישור מקדים. שני השדות המרכזיים שצריך לעבד הם problem ו־tests, אם כי הכרטיס מציין שבחלקים מסוימים קיימים שדות נוספים שמשתנים בהתאם למקור הדאטה.

from datasets import load_dataset

ds = load_dataset("agentica-org/DeepCoder-Preview-Dataset")

הרישיון

המאגר מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. המודלים שמאומנים על הנתונים אינם מחויבים ברישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗