GPT
C

Code-Contests-Plus

קוד פתוח

ByteDance-Seedcc-by-4.02025-06-03

  • code

המאגר מרחיב בעיות תכנות תחרותי עם מקרי בדיקה חדשים, מחוללים ובודקים ייעודיים. הוא פותר את בעיית האמינות הנמוכה של בדיקות ישנות בבחינת מודלי קוד.

  • 10,826הורדות בחודש
  • 69לייקים

מה זה

הבסיס מגיע מהדאטהסט CodeContests המוכר של דיפמיינד, וכולל 11,690 בעיות תכנות תחרותי יחד עם מעל 13 מיליון פתרונות נכונים ושגויים. עבור כל בעיה נבנתה מערכת סוכנים שיצרה מקרי קצה, מחולל בדיקות, ולידטור שמוודא עמידה במגבלות הבעיה, ובודק פלט עבור מקרים שבהם יש יותר מתשובה נכונה אחת.

התוכן מחולק לשישה תתי מאגרים: default ללא מקרי בדיקה מראש, וחמש גרסאות מדורגות מ־1x עד 5x שמכילות בין 25 ל־98 מקרי בדיקה בממוצע לבעיה. לכל בעיה נמדדו שיעורי TPR ו־TNR באמצעות 100 פתרונות נכונים ו־100 שגויים, מה שמאפשר לסנן בעיות לפי רמת דיוק הבדיקות.

מתאים ל

  • הערכת מודלי שפה לקוד

    בדיקת איכות הקוד שנוצר על ידי הרצת מקרי הבדיקה המורחבים והוולידטורים.

  • אימון ואימות פתרונות

    שימוש במיליוני הפתרונות הנכונים והשגויים ללמידת דירוג ותיקון שגיאות.

  • יצירת בדיקות אוטומטית

    הפעלת מחוללי הבדיקות לבניית מקרי קצה נוספים בכמות בלתי מוגבלת.

איפה זה נופל

הבעיות עוסקות בתכנות תחרותי ואלגוריתמיקה בלבד, כך שהן לא מייצגות פיתוח תוכנה יומיומי או מערכות פרודקשן. הטקסטים והקוד מבוססים על אנגלית ואינם כוללים עברית כלל. בנוסף, למרות מערכת הסינון והבדיקות הקפדניות, לא כל הבעיות מגיעות לציון מושלם, ולמי שדורש אמינות מחמירה עדיף להשתמש בגרסת Verified שבה המדדים עומדים מעל 0.9.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

כן, הרישיון הוא CC-BY-4.0 ומאפשר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור למפרסמים וציון שינויים שבוצעו. אין חובה לפתוח את הקוד שלכם או לשחרר את המודלים באותו רישיון.

מה ההבדל בין המאגר הזה ל־CodeContests המקורי?

המאגר המקורי סבל ממקרי בדיקה חלקיים שלא תמיד פסלו פתרונות שגויים. כאן נוספו מקרי קצה חדשים, מחוללים אוטומטיים, ולידטורים לקלט ובודקים ייעודיים לבעיות עם כמה תשובות נכונות. התוצאה היא יכולת טובה בהרבה להבדיל בין קוד תקין לשגוי.

האם יש במאגר תמיכה בעברית?

לא, כל בעיות התכנות, התיאורים, ההערות והקוד כתובים באנגלית. אין במאגר נתונים או משימות שקשורים לשפה העברית.

איזו גרסה מתוך השישה כדאי לטעון?

גרסת 1x מספקת נקודת התחלה טובה שכוללת בממוצע 25 מקרי בדיקה לבעיה בלי להעמיס יותר מדי על משאבי החישוב. אם רוצים רק את הגדרות הבעיות והפתרונות ללא בדיקות, טוענים את default. גרסאות 4x ו־5x מיועדות למקרים שבהם דורשים כיסוי מקסימלי ומוכנים לשלם בזמן ריצה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והתצורה הרצויה, כמו default או 1x. הגישה דורשת התחברות לחשבון Hugging Face, והקבצים שמורים בפורמט Parquet המחולק לחלקים. אם אתם מתכננים להריץ את כל הבדיקות בגרסאות הגבוהות כמו 5x, קחו בחשבון עלויות חישוב וזמני ריצה ארוכים בהרבה.

from datasets import load_dataset

ds = load_dataset("ByteDance-Seed/Code-Contests-Plus")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים ייחוס הולם למחברים ומציינים אם נעשו שינויים. אימון מודל על הנתונים הללו מותר, ואין דרישה להפיץ את המודל המאומן תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗