GPT
G

github-jupyter-code-to-text

קוד פתוח

codeparrotapache-2.02022-07-19

  • code

המאגר מרכז קטעי פייתון מתוך מחברות ג׳ופיטר ולצדם הסברים טקסטואליים שנכתבו עליהם. מי שרוצה ללמד מודל לתעד קוד או להסביר פעולות ימצא כאן דוגמאות מוכנות בדיוק לזה.

  • 3,605הורדות בחודש
  • 26לייקים

מה זה

הנתונים מבוססים על מחברות Jupyter שנלקחו מגיטהאב, ועברו עיבוד שחיבר תאי קוד יחד עם תאי המרק Meltdown שהסבירו אותם במקור. המפרסמים לקחו מאגר קודם של זוגות טקסט וקוד, והפכו את הסדר כדי להתאים למשימה של יצירת הסבר מקוד קיים.

בתוך השדה המרכזי מופיע רצף שמתחיל בקוד פייתון, ומיד אחריו מחרוזת תיעוד מובנית שפותחת במילה Explanation ומסתיימת בציון סוף ההסבר. המבנה הזה חוזר על עצמו ברצף לאורך הרשומה, לצד מטא דאטה שכולל את שם המאגר המקורי, הנתיב לקובץ והרישיון שזוהה בו. החלוקה הפנימית מפרידה את הנתונים לשני קבצי פארקט, אחד לאימון שמכיל 47452 דוגמאות ואחד למבחן.

מתאים ל

  • אימון מודל לתיעוד קוד

    יצירת דוקסטרינג והסברים לפונקציות פייתון קיימות על בסיס מבנה הדוגמאות.

  • הערכת ביצועי מודלי שפה

    בדיקת היכולת של מודל קיים להבין מה קוד עושה מול חלק המבחן.

  • הסבת מחברות לסקריפטים מתועדים

    אימון כלי שמנקה מחברות ג׳ופיטר ומכניס את ההערות ישירות לקוד עצמו.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין פה נגיעה לשפות אחרות או לעברית. המחברות נאספו בקיץ 2022, כך שקוד מודרני יותר שנכתב מאז לא מיוצג כאן. הבעיה המרכזית היא שאיכות ההסברים תלויה לחלוטין במה שמשתמשי גיטהאב כתבו במקור במחברות שלהם, בלי סינון של איכות הניסוח או דיוק ההסבר הטכני.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

רישיון המאגר הוא apache-2.0, ולכן אין מניעה חוקית לאמן עליו מודלים מסחריים. עם זאת, כל רשומה כוללת שדה רישיון שמציין את המקור בגיטהאב, וכדאי לסנן רשומות שמקורן ברישיונות מגבילים לפני תחילת האימון.

האם יש במאגר תמיכה בעברית?

לא. הדאטהסט מוגדר באנגלית בלבד וכולל קוד פייתון והסברים באנגלית שנלקחו מגיטהאב. מי שמחפש הסברים בעברית לקוד לא ימצא אותם כאן.

איך הנתונים נאספו ונבנו?

היוצרים חיברו תאי קוד ותאי מרקדאון ממחברות Jupyter קיימות. הם לקחו מאגר זוגות קודם והיפכו אותו, כך שהקוד מופיע ראשון ואחריו ההסבר בתוך בלוק תחום.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי שום צורך לבקש הרשאות או להמתין לאישור. הגישה פתוחה לגמרי, והקבצים שמורים בפורמט parquet יעיל שמחולק לקובץ train וקובץ test נפרדים. מספיקה פקודת load_dataset פשוטה כדי להתחיל לעבוד. השדה המשמעותי ביותר הוא content שמכיל את רצף הקוד וההסברים, לצד repo_name ורישיון המקור.

from datasets import load_dataset

ds = load_dataset("codeparrot/github-jupyter-code-to-text")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה בלי לחייב פתיחה של הקוד שלכם באותו רישיון. נדרש רק לתת ייחוס מתאים למקור. אימון מודל על הנתונים מותר, אבל צריך לזכור שהקוד עצמו נאסף ממאגרים שונים בגיטהאב שנושאים רישיונות משלהם, שמופיעים בשדה הרישיון בכל רשומה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗