GPT
O

Open-Critic-GPT

קוד פתוח

Vezoraרישיון לא דווח2024-07-27

המאגר מכיל דאטה סינתטי שנועד ללמד מודלים לאתר באגים בקוד ולתקן אותם. הוא מתאים למי שרוצה לאמן מודל ביקורת קוד בלי לאסוף ידנית אלפי דוגמאות של שגיאות ותיקונים.

  • 132הורדות בחודש
  • 96לייקים

מה זה

הנתונים נולדו מתהליך סינתטי שבו מודל מקומי לקח קטעי קוד קיימים, השתיל בתוכם באגים באופן מכוון, ואז הסביר בגוף ראשון מה הבעיה ואיך לפתור אותה. המקור המרכזי לקוד הבסיסי הוא המאגר CodeFeedback-Filtered-Instruction, שמורכב בעצמו ממקורות כמו Magicoder ושאילתות Python מרוכזות.

התוכן מחולק רעיונית לשני שימושים עיקריים שכוללים סביב 55 אלף דוגמאות. החלק הראשון מכוון לאימון העדפות עם זוגות של קוד תקין מול קוד שבור, והחלק השני מיועד ללימוד ביקורת ותיקון, שבו מופיע קטע שבור, הסבר מפורט על מהות הבאג ואיך להימנע ממנו, ולבסוף גרסה תקינה ועובדת.

מתאים ל

  • אימון DPO לביקורת קוד

    לימוד מודל לזהות כשלים תחביריים ולוגיים, להסביר אותם ולכתוב את הקוד מחדש בצורה מתוקנת.

  • אימון SFT להעדפת קוד

    שימוש בזוגות הקוד התקין והשבור כדי לכוונן מודלים להעדיף פתרונות נקיים מבאגים.

  • בניית מסייע לתיקון שגיאות

    הזנת קטעי קוד תקולים וקבלת הסבר מפורט יחד עם מימוש עובד בעשרות שפות פיתוח.

איפה זה נופל

תהליך ההפקה איבד יותר ממחצית מהמידע המקורי בגלל בעיות בפלט המובנה של המודל המייצר, מתוך 122 אלף דוגמאות שרדו רק כ־55 אלף. בנוסף, כל הבאגים וההסברים נוצרו באמצעות מודל מקומי שהורץ על כרטיס RTX 3090 בודד. זה אומר שיש סיכוי גבוה להזיות, הסברים עקומים על תקלות שלא באמת קיימות, או תיקונים שלא באמת מתקמפלים. חובה לדגום ולבדוק את איכות הקוד וההסברים לפני שמשקיעים שעות GPU באימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

היוצר מגדיר את הרישיון כגרסה של Apache 2.0 שדורשת קרדיט בלבד. עם זאת, הוא מחריג במפורש את חברת OpenAI ועובדיה משימוש בחומרים, כך שאם אתם לא שייכים לגוף הזה, השימוש פתוח.

האם המאגר כולל עברית?

לא. הקוד וההסברים הטכניים נוצרו כולם באנגלית, על בסיס 127 שפות תכנות ומבני קוד שונים. אין בו נתונים בשפה העברית.

איך נוצרו הבאגים והתיקונים בדאטהסט?

מודל מקומי לקח קוד קיים ממקורות פתוחים, שתל בו שגיאות בצורה סינתטית, ואז ניתח את הבעיות וכתב פתרון מתוקן. לאחר מכן הוסרו הערות טקסטואליות כמו bug ו־error כדי שהמודל שמתאמן לא יסתמך על רמזים בקוד.

מדוע חלק ניכר מהדוגמאות המקוריות נמחק?

היוצר התחיל עם 122 אלף דוגמאות אך סיים עם כ־55 אלף בלבד. הנשירה קרתה בגלל שהמודל המייצר התקשה להפיק פלט במבנה אחיד ותקין, ורשומות שלא עמדו במבנה נזרקו בתהליך ההמרה.

איך טוענים

הקובץ המרכזי במאגר מגיע בפורמט Open-Critic-GPT.jsonl לצד קובץ רישיון. אין צורך באישור גישה מיוחד כדי למשוך את הקבצים מחשבון Vezora. כדי לעבוד איתו באימון, חשוב להגדיר data collator מתאים שמונע חישוב loss על קטעי הקוד השבורים עצמם, כדי שהמודל ילמד לייצר רק את התיקון וההסבר ולא ישנן את השגיאות.

from datasets import load_dataset

ds = load_dataset("Vezora/Open-Critic-GPT")

הרישיון

למרות שבמטה דאטה הרישיון מסומן כלא דווח, היוצר מצהיר בתיאור על רישיון Apache 2.0 מותאם אישית. הרישיון מתיר שימוש חופשי כולל מסחרי ודורש מתן קרדיט, אך כולל סעיף מפורש שאוסר על עובדי חברת OpenAI או על החברה עצמה להשתמש במידע לאימון. התניה כזו חורגת מהגדרת קוד פתוח סטנדרטית.

הרישיון המלא ב־Hugging Face ↗