GPT
C

Code-Feedback

קוד פתוח

m-a-papache-2.02024-02-23

  • code

מאגר שמביא שיחות קוד שכוללות הרצה ותיקון שגיאות באיטרציות. הוא מיועד למי שרוצה לאמן מודל שלא רק פולט פייתון, אלא יודע להתמודד עם פלט שחוזר מהטרמינל.

  • 4,830הורדות בחודש
  • 240לייקים

מה זה

המאגר מיועד למשימות של מענה לשאלות סביב קוד, כחלק מפרויקט OpenCodeInterpreter. הרעיון המרכזי כאן הוא שילוב של הרצת הקוד ותיקון עצמי בעקבות משוב, בדומה לאופן שבו מתנהג כלי כמו Code Interpreter. לפי מה שפורסם, חלק מהנתונים יוצרו באמצעות מודלים מסחריים, ספציפית GPT-4-0613 וגרסת GPT-3.5-turbo-0613.

המפרסמים לא פירטו בכרטיס את מבנה הרשומות המדויק, אילו שפות תכנות נמצאות שם מעבר למה שמשתמע, או איך בדיוק בוצע הסינון. כל המידע המלא על אופן הבנייה מופנה למאמר האקדמי שלהם, כך שבכרטיס עצמו מקבלים בעיקר את קובץ הנתונים עם אזהרה לגבי תנאי השימוש במודלים סינתטיים.

מתאים ל

  • אימון תיקון קוד באיטרציות

    לימוד מודל לקרוא פלט שגיאה של הרצה ולתקן את הפונקציה שכתב בלי עזרה אנושית.

  • פיתוח סוכן פיתוח

    בניית צ'אט שמסוגל לענות על שאלות תכנות, להציג שלבי פתרון ולהגיב למשוב מהקומפיילר.

  • בדיקת יכולות פירוש קוד

    הערכת ביצועים של מודלים קיימים במשימות שדורשות מעקב אחרי ביצוע והבנת תוצאות הרצה.

איפה זה נופל

החולשה המרכזית נמצאת באזהרה שהמפרסמים עצמם שמו. חלק מהתוכן יוצר על ידי מודלים של OpenAI, מה שמכניס תלות במדיניות השימוש שלהם ומגביל אימון של מודלים מתחרים ישירים. חוץ מזה, השפה היחידה שמדווחת היא אנגלית. מי שמחפש תיעוד בעברית, הערות בקוד בשפות אחרות או בדיקות מול סביבות פיתוח מקומיות לא ימצא אותם כאן. הכרטיס גם לא מפרט אילו שפות תכנות נדגמו ואיך בדקו שהקוד שרץ לא כולל בעיות אבטחה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון של המאגר הוא apache-2.0, שבאופן עקרוני מתיר שימוש מסחרי חופשי למדי. הבעיה היא שהיוצרים מציינים במפורש שחלק מהדאטה נוצר ב־GPT-4 וב־GPT-3.5, ולכן חלים עליו תנאי השימוש של OpenAI שאוסרים להתחרות בהם ישירות בעזרת התוצרים שלהם. מי שבונה מוצר מסחרי צריך לבדוק היטב את תנאי השימוש האלה לפני שהוא מאמן.

האם יש במאגר תמיכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד. אם תאמנו עליו מודל, הוא לא ילמד להסביר קוד בעברית או לנהל שיחה עם מפתח ישראלי בשפת האם שלו.

איך הנתונים נאספו ונבנו?

הכרטיס לא מפרט את תהליך האיסוף המלא ושולח למאמר האקדמי של OpenCodeInterpreter. מה שכן כתוב בעמוד הוא שהמאגר נועד לשלב כתיבת קוד עם הרצה ותיקון, ושחלק מהתוכן גוּנרט באמצעות מודלים של OpenAI.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face בעזרת המזהה שלו. אין כאן צורך באישור גישה מראש או בטפסים, המאגר פתוח להורדה. הקובץ המרכזי יושב בפורמט jsonl פשוט שנוח לפרוס בכל שרת אימון, לצד שני קבצים נוספים במאגר. גודל הקובץ המדויק בדיסק לא צוין בעמוד, אבל מדובר בקובץ יחיד שמכיל את כל השיחות.

from datasets import load_dataset

ds = load_dataset("m-a-p/Code-Feedback")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה בלי חובת שיתוף תחת אותו רישיון, ומחייב רק מתן קרדיט ושמירה על הודעות הרישיון. עם זאת, בגלל שחלק מהנתונים הגיעו מתוצרי GPT-4 ו־GPT-3.5, תנאי השימוש של OpenAI עדיין חלים עליהם. מי שמתכנן לאמן מודל מסחרי חייב לקחת בחשבון את ההגבלות האלה מעבר לרישיון הפתוח הרשמי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗