GPT
C

Code-Reasoning

קוד פתוח

IFMapache-2.02026-08-24

  • k2-horizon
  • training-data
  • parquet
  • code
  • reasoning

פתרון בעיות קוד עם שרשראות חשיבה, תשובות ישירות וסינתזה של משימות. הוא מחלק משימות תכנות למספר רמות קושי וסגנונות הסבר כדי לאמן מודלים לחשוב לפני שהם פולטים קוד.

  • 5,428הורדות בחודש
  • 29לייקים

מה זה

המאגר מחולק לשבעה תתי-מאגרים שונים שכל אחד מהם מייצג סגנון אימון אחר. יש כאן חלוקה בין פתרונות ישירים ללא שרשרת חשיבה לבין פתרונות מפורטים שכוללים תהליכי הסקת מסקנות, בשתי רמות קושי נפרדות. בנוסף תמצאו גרסאות מוקדמות של חשיבה, תת-מאגר ייעודי לקלט פלט של קוד, וחלק שמתמקד ביצירה סינתטית של משימות תכנות.

המקור המדויק של כל רשומה לא מפורט במלואו ברמת השורות הבודדות, אך המפרסמים מציינים שכל חלק עבר סינון ייעודי, ניקוי, הסרת כפילויות, ציוני איכות או יצירת נתונים סינתטיים. שמות הקבצים מעידים גם על ניקוי והסרה של קוד פתוח מסוים מחלק מהמקטעים. כל הנתונים מוגשים בפיצול אימון יחיד שנשמר במקור מפורמט ג'ייסון והומר לקבצי פארקט מרובים.

מתאים ל

  • אימון מודלי חשיבה לקוד

    לימוד מודל לפרק בעיית תכנות מורכבת לשלבים לוגיים לפני כתיבת המימוש הסופי.

  • אימון פתרונות קוד מהירים

    שימוש במקטעים ללא חשיבה כדי לאמן מודלים להחזיר קוד עובד ישירות בלי הסברים ארוכים.

  • יצירה סינתטית של בעיות

    הפקת משימות תכנות חדשות ובדיקות קלט פלט לצורך הרחבת דאטהסטים פנימיים.

איפה זה נופל

הכרטיס מודה בפירוש שהנתונים עשויים לכלול שגיאות עובדתיות, כפילויות, תוכן לא בטוח או סטריאוטיפים. המפרסמים לא חושפים את שפות התכנות הספציפיות שנכללות, את היקף השפות האנושיות, או את תאריכי הגזירה המקוריים של הקוד. אין מידע על עברית, וכנראה שההסברים כולם באנגלית. אם אתם בונים כלי שמייצר קוד לסביבת ייצור, תצטרכו להריץ בעצמכם בדיקות בטיחות ולוודא שהקוד לא מייצר חולשות אבטחה ידועות.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי לחברה?

כן, הרישיון הוא אפאצ'י שתיים אפס, והוא מאפשר שימוש מסחרי מלא באימון מודלים ובבניית מוצרים. הדרישה העיקרית היא הכללת עותק הרישיון ומתן ייחוס למפרסמים המקוריים.

האם יש במאגר משימות תכנות או הסברים בעברית?

בתיעוד הרשמי אין שום אזכור לשפה העברית. סביר מאוד להניח שכל משימות התכנות, התיעוד ושרשראות החשיבה מנוסחים באנגלית בלבד.

האם אפשר להוריד רק סגנון נתונים אחד ולא את כל הקבצים?

כן, המאגר בנוי מתתי-מאגרים נפרדים כמו נתונים עם חשיבה, נתונים קשים או קלט פלט. אפשר לטעון בסקריפט רק תת-מאגר בודד בלי להוריד את אלפי הקבצים האחרים.

איך הנתונים עברו סינון ואימות לפני הפרסום?

היוצרים מציינים שהנתונים עברו הסרת כפילויות, סינון איכות, וניקוי מבוסס מקור. שמות הקבצים גם חושפים הסרה של קוד פתוח מסוים, אך אין תיעוד מפורט על אופי הבדיקות המדויק.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים של האגינג פייס על ידי ציון שם תת-המאגר הרצוי, למשל החלק של פתרונות ישירים. אין צורך בבקשת גישה מיוחדת או באישור ידני. מכיוון שמדובר במאגר שמכיל מעל אלף ושש מאות קבצים, מומלץ להשתמש בהזרמה במקום להוריד הכל בבת אחת. שמות השדות והמבנה הפנימי אינם אחידים ומשתנים בין תת-מאגר אחד לאחר, ולכן חובה לבדוק את מבנה הרשומה הראשונה לפני שמתחילים להריץ תהליך אימון מלא.

from datasets import load_dataset

ds = load_dataset("IFM/Code-Reasoning")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים, ושילוב שלהם במוצרים מסחריים בלי חובה לשתף את הקוד שפותח באותו רישיון. נדרש רק לתת ייחוס מתאים ולצרף עותק של תנאי הרישיון. מודלים שאומנו על הנתונים האלה אינם כבולים לחובת קוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗