GPT
C

code_contests

קוד פתוח

deepmindcc-by-4.02022-07-19

מאגר בעיות תכנות תחרותי שמכיל תיאורי משימות, בדיקות קלט פלט ופתרונות אנושיים נכונים ושגויים. הוא נבנה עבור אימון והערכת מודלים כמו אלפא קוד על אלגוריתמיקה מורכבת.

  • 59,141הורדות בחודש
  • 233לייקים

מה זה

כל רשומה מייצגת בעיית תכנות מלאה. היא כוללת את תיאור המשימה באנגלית, מקרי בדיקה ציבוריים, פרטיים וכאלה שנוצרו אוטומטית, לצד פתרונות קוד במספר שפות כמו פייתון, ג'אווה וסי פלוס פלוס. הנתונים כוללים פתרונות נכונים ושגויים כאחד, ומטא דאטה על מגבלות זמן וזיכרון.

המקורות נאספו מאתרי תחרויות מוכרים כמו קודפורסס, אטקודר, קודשף, אייזו והאקר ארת', וכן ממאגרים קיימים כמו דסקריפשן טו קוד ופרויקט קודנט של יבמ. חלק מהבעיות תורגמו לאנגלית, והגרסה המקורית שלהן נשמרה בשדה ייעודי.

החלוקה הפנימית כוללת 13,328 בעיות לאימון, 117 בעיות לוולידציה ו־165 בלבד למבחן. זהו פיצול מכוון שמיועד להערכה ממוקדת מאוד על סט מבחן קטן וקשה, ולא לחלוקה אקראית רגילה.

מתאים ל

  • אימון מודלים לייצור קוד

    אימון מודלי שפה על פתרון בעיות אלגוריתמיות מורכבות מטקסט חופשי לקוד תקין.

  • הערכת ביצועי מודלים

    בדיקת איכות קוד באמצעות הרצת מקרי הבדיקה הפרטיים והאוטומטיים על פלטים.

  • זיהוי שגיאות בקוד

    שימוש במאגר הפתרונות השגויים כדי לאמן מודלים לאתר באגים ולתקן אותם.

איפה זה נופל

הכרטיס מודה בחסרים רבים: אין בו מידע על הטיות, השפעה חברתית או פרטים אישיים שעלולים להסתתר בפתרונות הגולמיים שנאספו מהרשת. כל הטקסטים מיושרים לאנגלית בלבד, כך שאין שום ייצוג לשפות אחרות כמו עברית. דירוגי הקושי אינם עקביים ומגיעים מסקלות שונות לחלוטין לפי פלטפורמת המקור, למעט שדות ספציפיים של קודפורסס. נוסף לכך, סט המבחן זעיר וכולל 165 דוגמאות בלבד, מה שמקשה על הסקת מסקנות סטטיסטיות רחבות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר הוא קריאייטיב קומונס ייחוס 4.0 שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, חלק מהתוכן נאסף מאתרי תחרויות ופרויקטים חיצוניים בעלי רישיונות שונים. חברות מסחריות צריכות לוודא שאיסוף הנתונים המקורי מאותם אתרים תואם את מדיניות השימוש שלהן.

האם המאגר כולל תוכן בעברית?

לא, המאגר מוגדר ומכיל בעיות באנגלית בלבד. חלק מהבעיות שנאספו במקור בשפות זרות תורגמו לאנגלית, אך עברית אינה קיימת כלל בנתונים.

במה המאגר הזה שונה ממאגרי קוד רגילים כמו גיטהאב?

בניגוד לקוד גולמי שנאסף ממאגרים ציבוריים, כאן יש צימוד ישיר בין תיאור משימה מילולי, פתרונות מלאים במספר שפות ומקרי בדיקה מדויקים להרצה. המבנה הזה מאפשר לבדוק בצורה אוטומטית אם הקוד שהמודל ייצר באמת עובד ועומד במגבלות זמן וזיכרון.

איך טוענים

המאגר מחולק לקובצי פרקט, כולל 40 קבצים עבור סט האימון, וזמין להורדה ישירה דרך ספריית הדאטאסטס של האגינג פייס ללא צורך באישור גישה. לפני שרצים לאמן, שימו לב למבנה: פתרונות הקוד ומקרי הבדיקה מקוננים בתוך כל רשומה כמערכים, מה שדורש פריקה ועיבוד מוקדם. השדות הקריטיים הם תיאור הבעיה, מקרי הבדיקה הציבוריים והפתרונות, לצד שפת הפיתוח שמסומנת כמספר מזהה שחובה למפות.

from datasets import load_dataset

ds = load_dataset("deepmind/code_contests")

הרישיון

המאגר מופץ תחת רישיון קריאייטיב קומונס ייחוס 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט הולם ליוצרים ומצוין אם בוצעו שינויים. אין דרישה לשתף נגזרות באותו רישיון. עם זאת, המקורות הבסיסיים כוללים חומרים מאתרים כמו קודפורסס ופרויקטים תחת רישיונות שונים כמו אפאצ'י 2.0 ו־MIT, ולכן מומלץ לבדוק את תנאי המקור לפני שמשלבים תוצרים במוצר מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗