GPT
C

code_exercises

קוד פתוח

jinaaicc-by-nc-sa-4.02023-08-17

יש כאן גם סקירה על Jina AI עצמו.

מאגר של כ־120 אלף תרגילי פייתון סינתטיים שנוצרו עם ChatGPT 3.5. הוא מתאים למי שרוצה לאמן מודלים קטנים לכתיבת קוד במבנה של מבחן Human Eval.

  • 1,521הורדות בחודש
  • 40לייקים

מה זה

המאגר מכיל תרגילים בפורמט שמחקה ישירות את Human Eval. כל רשומה כוללת חתימת פונקציה בפייתון יחד עם docstring שמתאר את המשימה, ובנפרד את הפתרון של התרגיל. בסך הכל יש כאן בערך 120 מיליון טוקנים שנועדו להזנת מודלים בתהליך זיקוק ידע.

כל המידע כאן הוא סינתטי לחלוטין ולא נאסף ממאגרי קוד אמיתיים. הצוות של Jina בנה עץ היררכי של 42 נושאים כלליים בפייתון, פירק אותם לכ־2,000 תתי-נושאים באמצעות מודל שפה, ושילב ביניהם באקראי יחד עם רשימה של 40 מקצועות שונים. מתוך עשרות מיליוני שילובים אפשריים, הם יצרו ודגמו את 120 אלף התרגילים שפורסמו כאן.

מתאים ל

  • זיקוק מודלי קוד

    אימון מודלים קטנים על פתרונות של ChatGPT 3.5 כדי לשפר את ביצועיהם במשימות השלמת פונקציות.

  • הכנה למבחן Human Eval

    כוונון מודלים על תרגילים במבנה התואם ישירות את הבנצ'מרק של OpenAI בפייתון.

  • מחקר על דאטה סינתטי

    בחינת השפעת גיוון פרומפטים מבוססי עץ נושאים על איכות הלמידה של מודלי שפה.

איפה זה נופל

הנתונים נוצרו כולם על ידי ChatGPT 3.5, ולכן הם מוגבלים לידע, לסגנון ולטעויות שלו ממועד יצירתם באוגוסט 2023. המאגר ממוקד רק בפייתון ובאנגלית, ואין בו שפות תכנות נוספות או תמיכה בעברית. מעבר לכך, המפרסמים מבהירים שהתרגילים נבנו סביב המבנה של Human Eval, מבחן שלא בהכרח מייצג יכולות תכנות רחבות, כך ששיפור במדד הזה לא מבטיח מודל שטוב בפיתוח אמיתי. בנוסף, לא מצוין תהליך בדיקה או הרצה של הקוד שמוודא שהפתרונות תקינים וללא באגים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר מפורסם תחת רישיון cc-by-nc-sa-4.0 שאוסר במפורש שימוש מסחרי. בנוסף, הנתונים נוצרו באמצעות ChatGPT 3.5, מה שמחייב בדיקה של תנאי השימוש של OpenAI ומגבלות קניין רוחני על תוכן סינתטי.

האם יש במאגר תמיכה בעברית?

לא, המאגר מוגדר וקיים באנגלית בלבד. התיעוד, הפונקציות וההסברים כתובים כולם באנגלית ומיועדים לקוד פייתון.

איך הבטיחו שהתרגילים יהיו מגוונים?

החוקרים בנו עץ של כ־2,000 תתי-נושאים בפייתון ושילבו בכל פרומפט שני נושאים אקראיים יחד עם מקצוע מתוך רשימה של 40 מקצועות. השיטה הזו איפשרה להם לייצר עשרות מיליוני שילובים שונים בלי לחזור על אותם ניסוחים.

האם הקוד במאגר נבדק ונמצא תקין?

כרטיס המאגר לא מדווח על הרצה של בדיקות יחידה או אימות שהקוד ש־ChatGPT יצר אכן עובד. הנתונים מוצגים כפי שהם, ולכן מומלץ לבדוק את הפתרונות באופן עצמאי לפני שמסתמכים עליהם.

איך טוענים

הנתונים מגיעים בקובצי Parquet סטנדרטיים ומחולקים לשלושה חלקים עיקריים תחת תיקיית data, לצד קובץ התיעוד. אפשר למשוך אותם ישירות דרך ספריית datasets בלי צורך באישור גישה או הרשמה מוקדמת. כל דוגמה מורכבת מתיאור המשימה עם חתימת הפונקציה ומהקוד הפותר, כך שהפורמט מוכן מיד למשימות של השלמת קוד ואימון.

from datasets import load_dataset

ds = load_dataset("jinaai/code_exercises")

הרישיון

הרישיון המדווח הוא cc-by-nc-sa-4.0. המשמעות היא שהשימוש מוגבל למטרות לא מסחריות בלבד, מחייב מתן קרדיט ליוצרים, וכל נגזרת חייבת להשתחרר תחת אותם תנאים. אם אתם שוקלים לאמן עליו מודל למוצר מסחרי, הרישיון הזה חוסם אתכם, ובנוסף צריך לקחת בחשבון את תנאי השימוש של OpenAI בנוגע לתוכן שנוצר על ידי ChatGPT.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗