GPT
C

CodeX-2M-Thinking

קוד פתוח

Modotteapache-2.02025-11-15

  • Coding
  • Code
  • CodeX
  • Modotte
  • LLM-training

שני מיליון דוגמאות קוד סינתטיות עם שרשרת חשיבה מפורטת לכל פתרון. המאגר מיועד לאימון מודלים שצריכים להסביר צעד אחרי צעד איך הם מתכננים ופותרים בעיות תכנות.

  • 2,517הורדות בחודש
  • 127לייקים

מה זה

המאגר כולל כשני מיליון רשומות המחולקות לפי רמות קושי, כאשר 30% מוגדרים כבסיסיים, 30% ברמת ביניים, ו־40% מוקדשים לאתגרים מורכבים כמו מבני נתונים, אופטימיזציה ותכנון מערכות. כל רשומה בנויה משלושה מרכיבים מרכזיים: תיאור הבעיה, תהליך חשיבה מפורט בשלבים, ופתרון קוד סופי שנועד להרצה. הנושאים מכסים תחומים כמו אלגוריתמים, פיתוח ווב, בינה מלאכותית, מערכות הפעלה, מסדי נתונים ותכנות תחרותי, בשפות כמו פייתון, ג'אווה, סי פלוס פלוס וג'אווהסקריפט.

מקור המידע מוגדר כסינתטי לחלוטין. הצוות שילב דוגמאות ממאגרים ציבוריים קיימים, כולל נתונים של אנבידיה, לצד ייצור סינתטי באמצעות מודלים בקוד פתוח וסגור. תהליך הסינון כלל הסרת כפילויות, סטנדרטיזציה של תחביר הקוד, הסרת הערות מיותרות, דירוג איכות לפי מורכבות ויעילות, ובדיקה אנושית מדגמית. המפתחים מדווחים כי כל פתרונות הקוד עברו אימות והרצה בסביבות בדיקה אוטומטיות כמו pytest לפני שנכללו במאגר.

מתאים ל

  • אימון מודלי חשיבה לקוד

    לימוד מודלים לייצר הסבר לוגי מפורט בשלבים לפני כתיבת פתרון התכנות בפועל.

  • כוונון עדין למודלי הוראות

    שיפור היכולת של מודלי שפה קיימים להבין משימות פיתוח מורכבות ולעקוב אחר הנחיות.

  • הערכת ביצועי מודלים

    בדיקת איכות הקוד והיכולת הלוגית של מודלים מול אלפי בעיות ברמות קושי שונות.

  • בניית כלי הדרכה למתכנתים

    פיתוח יישומים שמסבירים למשתמשים צעד אחר צעד איך לגשת לאלגוריתמים ולפתור באגים.

איפה זה נופל

הטקסטים במאגר מופיעים באנגלית בלבד ואין בו תמיכה בשפות אחרות. למרות הסינון האוטומטי, מדובר בדאטה סינתטי שיוצר בחלקו על ידי מודלים סגורים, כך שקיימת סכנה מובנית של חזרתיות בסגנון הפתרונות והסברים שנשמעים משכנעים אך מכילים כשלים לוגיים סמויים. הכרטיס אינו מציין אילו גרסאות של שפות וספריות נבדקו, ולכן יש לוודא תאימות של הקוד לסביבות הרצה מודרניות לפני שמבססים עליו מערכות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון Apache 2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים והפצתם, בתנאי ששומרים על ייחוס ועל עותק מהרישיון. עם זאת, היות שחלק מהנתונים הופקו באמצעות מודלים סגורים, מומלץ לוודא שתנאי השימוש של אותם ספקי מודלים אינם מגבילים יצירת מוצרים מתחרים.

האם הדאטהסט כולל נתונים בעברית?

לא. המאגר מוגדר כמאגר באנגלית בלבד, וכל תיאורי הבעיות, שלבי החשיבה והפתרונות כתובים בשפה זו. אם המטרה שלכם היא מודל שמסביר קוד בעברית, תצטרכו לתרגם את הנתונים או לשלב מקורות נוספים.

איך נאסף המידע ומה מבטיח שהקוד עובד?

הנתונים נאספו ממאגרים ציבוריים, כולל נתוני ייחוס של אנבידיה, והורחבו בייצור סינתטי של מודלים פתוחים וסגורים. המפרסמים מציינים שכל פתרון עבר בדיקת תחביר והרצה בפועל באמצעות סביבות בדיקה אוטומטיות כגון pytest, לצד בדיקה מדגמית של מומחים.

במה המאגר הזה שונה ממאגרי קוד רגילים?

בניגוד למאגרים שמכילים רק צמדים של שאלה וקוד סופי, כאן כל רשומה כוללת תהליך חשיבה מובנה בשלבים המקדים את הפתרון. המבנה הזה מכוון ישירות לאימון מודלים בסגנון reasoning, שמפרקים בעיה לגורמים לפני שהם מייצרים פלט.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון באמצעות הפקודה load_dataset עם המזהה Modotte/CodeX-2M-Thinking. הגישה חופשית ואינה דורשת אישור מראש או מפתח מיוחד. המידע מחולק ל־253 קבצי Parquet נפרדים, כך שכדאי להיערך להורדה של נפח נתונים משמעותי ולשקול טעינה בסטרימינג אם עובדים עם זיכרון מוגבל. בכל דוגמה תמצאו את הגדרת הבעיה, שלבי החשיבה והקוד הסופי.

from datasets import load_dataset

ds = load_dataset("Modotte/CodeX-2M-Thinking")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה ללא עלות, ומבלי לחייב פתיחה של הקוד שלכם באותו רישיון. נדרש לשמור על הודעת זכויות היוצרים והרישיון המקורי. מודלים שתאמנו על הדאטהסט אינם מושפעים ממגבלת שיתוף זהה, אך אם המידע הסינתטי נוצר באמצעות מודלים מסחריים סגורים, תנאי השימוש של אותם מודלי מקור עשויים להגביל שימושים מסוימים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗