GPT
C

codeforces-cots

קוד פתוח

open-r1cc-by-4.02025-02-27

עשרת אלפים בעיות תכנות תחרותי מ־CodeForces עם שרשראות חשיבה וקוד שנוצרו על ידי DeepSeek R1. החומר מתאים למי שרוצה לאמן מודלים על פתרון בעיות אלגוריתמיות מורכבות.

  • 6,264הורדות בחודש
  • 225לייקים

מה זה

המאגר מכיל עשרת אלפים בעיות תכנות שנלקחו מ־CodeForces, ולכל בעיה הוצמדו עד חמישה פתרונות מלאים שכוללים את שלבי החשיבה של המודל. ברירת המחדל של הפתרונות היא בשפת C++, אבל קיימות גם הרחבות עם פתרונות בשפת פייתון שכוללות פתרון יחיד לכל בעיה.

התוכן מחולק לכמה תתי-מאגרים לפי סוג המשימה והפרומפט שניתן למודל. יש חלק של פתרונות ישירים, חלק שבו המודל קיבל גם פתרון אנושי כעזר, גרסה שמכילה רק את הפתרון הקצר והארוך ביותר מטעמי יעילות, וכן חלקים שמיועדים לייצור מקרי קצה ולסיווג אופן בדיקת התשובות. בנוסף, קיימות גרסאות שעברו ניקוי דליפות נתונים.

מתאים ל

  • אימון מודלי חשיבה לקוד

    אימון ישיר על שרשראות החשיבה ב־C++ ופייתון כדי לשפר פתרון אלגוריתמים.

  • יצירת מקרי קצה לבדיקות

    שימוש בתת-המאגר הייעודי לאימון מודלים שמייצרים מקרי בדיקה מורכבים.

  • אימון חסכוני במשאבים

    שימוש בתת-המאגר המצומצם שמכיל רק את הפתרון הקצר והארוך לחסכון בזמן.

איפה זה נופל

היוצרים לא ביצעו סינון של שרשראות החשיבה והקוד לפי נכונות, כך שיש שגיאות בתוך הדאטהסט. לפי הבדיקה שלהם, רק שמונים וארבעה אחוזים מפתרונות הפייתון עוברים את הבדיקות הפומביות. בנוסף, אין כאן שום תוכן בעברית. כל הבעיות וההסברים באנגלית ובשפות תכנות, וחובה לוודא שאינכם מאמנים על קוד שגוי אם הדיוק הוא קריטי עבורכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא cc-by-4.0 שמתיר שימוש מסחרי חופשי. התנאי העיקרי הוא מתן קרדיט וייחוס מתאים ליוצרי המאגר.

האם יש בדאטהסט תמיכה או נתונים בעברית?

לא, אין כאן עברית כלל. השאלות, ההסברים והקוד מקורם באנגלית ובשפות C++ ופייתון בלבד.

האם כל הקוד והפתרונות במאגר נכונים ותקינים?

ממש לא, והיוצרים מציינים זאת במפורש. הם לא סיננו את התוצאות, ולפי הבדיקה שלהם רק כשמונים וארבעה אחוזים מפתרונות הפייתון עברו את הבדיקות בהצלחה.

באילו שפות תכנות הפתרונות כתובים?

רוב תתי-המאגרים מכילים פתרונות שנכתבו בשפת C++. הגרסאות שמסתיימות בסיומת py כוללות פתרונות בשפת פייתון, אך שם יש פתרון אחד בלבד לכל בעיה.

איך טוענים

הנתונים יושבים בקובצי Parquet ומחולקים לפי התיקיות של תתי-המאגרים, כך שאפשר למשוך רק את החלק הרלוונטי בעזרת ספריית datasets הרגילה. המאגר פתוח לחלוטין לציבור ללא צורך בבקשת אישור גישה. כל תת-מאגר כולל עמודת messages מוכנה, מה שמאפשר להזין את הדוגמאות ישירות לתהליכי אימון מבוסס הוראות בלי לבצע עיבוד מקדים של השיחות.

from datasets import load_dataset

ds = load_dataset("open-r1/codeforces-cots")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו בפרויקטים אחרים, בתנאי שנותנים ייחוס מתאים למפרסמים. הרישיון לא דורש שיתוף תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗