GPT
C

CodeIO-PyEdu-Reasoning

קוד פתוח

hkust-nlpodc-by2025-02-09

המאגר מציע דאטה לחיזוק יכולות חשיבה במודלי שפה דרך חיזוי קלט ופלט של קוד פייתון. הוא מתאים למי שרוצה לאמן מודלים להסקה לוגית עמוקה בלי להסתמך רק על טקסט חופשי.

  • 570הורדות בחודש
  • 58לייקים

מה זה

המאגר מכיל קובץ מרכזי בשם pyedur_full.jsonl ומתמקד במשימות של הבנת קוד, ניתוח זרימת ביצוע והסקת תוצאות מתוך קוד פייתון לימודי. הרעיון המרכזי במחקר שמלווה אותו הוא זיקוק תבניות חשיבה על ידי מעקב אחרי מה שהקוד מבצע בפועל.

החוקרים שחררו לצד המאגר הזה גם גרסה גולמית יותר של הנתונים, וכן סדרת מודלים שאומנו עליו בשני שלבים שונים, ביניהם גרסאות של LLaMA ושל Qwen. התיעוד בכרטיס עצמו מינימלי למדי ואינו מפרט את כמות השורות המדויקת או את שלבי הסינון שעברו הנתונים עד לקובץ הסופי.

מתאים ל

  • אימון מודלי חשיבה

    לימוד מודלי שפה לעקוב אחרי ביצוע תוכניות פייתון ולהסיק פלט מתוך קלט.

  • הערכת יכולות לוגיות

    בדיקת היכולת של מודלים קיימים להבין מבני קוד מורכבים ולחזות שגיאות.

  • שיפור ביצועי קוד

    אימון שלבי ביניים עבור מודלים ייעודיים לתכנות ופתרון בעיות אלגוריתמיות.

איפה זה נופל

הכרטיס לא מספק פרטים טכניים על אופן הסינון, מקורות הקוד המקוריים או בדיקות שנעשו לגילוי דליפות נתונים ממבחני ביצועים מקובלים. בנוסף, מדובר בקוד פייתון בלבד ולכן הוא לא יסייע למי שמחפש לשפר מודלים בשפות תכנות אחרות. אין בתיעוד שום התייחסות לטקסט בשפות שאינן אנגלית, ולפני אימון מודל פרודקשן תצטרכו לדגום את הנתונים ידנית כדי לוודא שאיכות ההסברים אכן עומדת ברף הנדרש.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא odc-by שמאפשר שימוש מסחרי חופשי. התנאי המרכזי הוא מתן קרדיט מתאים למחקר ולצוות שפרסם את הנתונים. אין כאן חובה לפתוח את הקוד או את המודל שתאמנו.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר מתמקד בקוד פייתון ובהסברים באנגלית. כל המשימות והטקסטים הנלווים לקוד נכתבו באנגלית בלבד. אם אתם מחפשים חיזוק יכולות בשפה העברית, הדאטהסט הזה לא ייתן לכם מענה ישיר.

איך הדאטהסט הזה נאסף ונבנה?

החוקרים אספו דוגמאות של קוד פייתון ממקורות לימודיים והפיקו סביבן משימות של חיזוי קלט ופלט. תהליך העיבוד נועד להפוך את הקוד לרצף של צעדי חשיבה והסקה. בכרטיס עצמו אין פירוט מעבר לכך, אך קיים קישור למאמר המלא שמסביר את השיטה לעומק.

איך טוענים

הנתונים מגיעים בקובץ JSONL בודד, כך שאפשר לקרוא אותו ישירות עם ספריית datasets של Hugging Face או באמצעות קריאת קובץ רגילה בפייתון. אין צורך בבקשת גישה מיוחדת או באישור ידני של החוקרים. לפני שטוענים אותו כדאי לבדוק את המבנה הפנימי של השורות בקובץ pyedur_full.jsonl כדי לראות באילו שדות שמורים קטעי הקוד וההסברים הנלווים אליהם.

from datasets import load_dataset

ds = load_dataset("hkust-nlp/CodeIO-PyEdu-Reasoning")

הרישיון

המאגר מופץ תחת רישיון odc-by. מדובר ברישיון פתוח שמתיר שימוש מסחרי, מחקר, שינוי והפצה של הנתונים, כל עוד אתם נותנים קרדיט מתאים למחברים המקוריים. הרישיון אינו דורש שיתוף תחת אותו רישיון, כך שניתן לשלב את הנתונים בתהליכי אימון של מודלים קנייניים.

הרישיון המלא ב־Hugging Face ↗