GPT
C

codeforces

קוד פתוח

open-r1cc-by-4.02025-02-12

מעל עשרת אלפים בעיות תכנות תחרותי מקודפורסס עם בדיקות קצה סינתטיות לאימות פתרונות. זה מיועד למי שמאמן מודלים להסקה לוגית בקוד וצריך סביבת בדיקה שלא נופלת בגלל טסטים חלקיים.

  • 13,184הורדות בחודש
  • 101לייקים

מה זה

המאגר מכיל מעל 10,000 בעיות שפורסמו בתחרויות מראשית הפלטפורמה ועד שנת 2025. כל רשומה כוללת את תיאור המשימה, מגבלות זיכרון וזמן, פורמט קלט ופלט, דירוג קושי ותגיות. בערך 60% מהבעיות מגיעות עם הסבר רשמי של מארגני התחרות לפתרון הנכון, ונוסחאות מתמטיות שהופיעו כתמונות חולצו לטקסט באמצעות מודל ראייה.

קודפורסס מקצרת פלטים מעל 400 תווים, ולכן טסטים ציבוריים מאפשרים לעיתים קרובות לפתרונות נאיביים לעבור. כדי לפתור את זה, החוקרים יצרו בדיקות חדשות ובודקים אוטומטיים באמצעות DeepSeek-R1, ואימתו אותם מול פתרונות אמיתיים של מתחרים. הנתונים מחולקים לשלוש תצורות: ברירת מחדל עם כלל הבעיות, תת קבוצה של 8,760 משימות שניתנות להרצה מלאה, ותת קבוצה המכילה פרומפטים מובנים בסי פלוס פלוס ובפייתון המיועדים ללמידת חיזוק.

מתאים ל

  • אימון מודלי הסקה בקוד

    שימוש בפרומפטים ובפתרונות הרשמיים לאימון מודלים על אלגוריתמים ומבני נתונים מורכבים.

  • למידת חיזוק עם משוב ביצועי

    הרצת בדיקות הקצה המורחבות כדי לתת תגמול מדויק לקוד שעובר את מגבלות הזמן והזיכרון.

  • הערכת יכולות תכנות מתקדמות

    בדיקת מודלים על פיצול המבחן מ־2024 ו־2025 כדי למדוד ביצועים על בעיות חדשות.

איפה זה נופל

המאגר מתמקד כולו בתכנות תחרותי באנגלית, בלי שום ייצוג לבעיות בעברית או לתחזוקת תוכנה אמיתית. בעיות אינטראקטיביות שנשענות על תקשורת רציפה מול בודק אינן נתמכות בסביבת ההרצה הנוכחית. בנוסף, חלק גדול מבודקי הפתרונות ובדיקות הקצה נוצרו בעזרת מודל שפה, ולמרות הסינון מול פתרונות אנושיים, ייתכנו מקרים שבהם הבדיקות הסינתטיות פוסלות פתרון תקין או מפספסות באגים מורכבים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון המקור מאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן קרדיט ברור ליוצרי המאגר לפי ההנחיות ברישיון CC-BY-4.0.

כמה שוקל הדאטהסט והאם נדרש מקום מיוחד בדיסק?

טבלאות הבעיות והפרומפטים שוקלות נפח רגיל של קובצי פרקט. בדיקות הקצה הסינתטיות שוקלות כ־110 גיגה בייט ומחייבות הורדה ייעודית מהמאגר אם רוצים להריץ אימות מלא.

האם הבעיות והפתרונות כוללים תמיכה בעברית?

לא. כל הבעיות, ההסברים, הפרומפטים והטסטים כתובים באנגלית בלבד, בדיוק כפי שהם מופיעים באתר קודפורסס.

מה ההבדל בין המאגר הזה למאגרי קודפורסס אחרים ברשת?

מאגרים קודמים כוללים בעיקר טסטים מקוצרים שלא מסננים פתרונות איטיים, ולרוב חסר בהם בודק לבעיות עם כמה פלטים תקינים. כאן הוסיפו עשרות אלפי טסטים כבדים ובודקים אוטומטיים שפותחו עם מודל שפה ונבדקו מול קוד אנושי.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets בפורמט פרקט, ללא צורך באישור גישה מיוחד. חלוקת הנתונים כוללת פיצול אימון ופיצול מבחן שמכיל בעיות מסוף 2024 ותחילת 2025, שנועד למנוע זליגת נתונים. שדות המפתח הם התיאור, הטסטים הרשמיים והקוד של הבודק האוטומטי.

אם אתם צריכים את בדיקות הקצה המורחבות לאימות פתרונות, קחו בחשבון שהן שוקלות כ־110 גיגה בייט. הקבצים האלה יושבים בנפרד ומחולקים לפי מזהה תחרות, כך שצריך להוריד אותם באמצעות כלי השורה של האגינג פייס.

from datasets import load_dataset

ds = load_dataset("open-r1/codeforces")

הרישיון

המאגר מוגדר בכרטיס תחת רישיון CC-BY-4.0 ובטקסט מוזכר גם ODC-By 4.0. שני הרישיונות מתירים שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצרים המקוריים. אין דרישה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗