GPT
C

code_clippy_github

קוד פתוח

CodedotAImit2022-03-02

מאגר קוד פתוח עצום מגיטהאב שמכיל 22 שפות תכנות שונות. הוא מיועד למי שרוצה לאמן מודלי שפה להשלמת קוד וזקוק לנפח דאטה גולמי ומגוון ישירות ממאגרים ציבוריים.

  • 8,316הורדות בחודש
  • 20לייקים

מה זה

הנתונים נשלפו ממאגר גיטהאב הציבורי ב־Google BigQuery בתחילת פברואר 2022. הם כוללים קבצי קוד מקור לפי סיומות מוגדרות מראש, ב־22 שפות כמו פייתון, ג'אווה, ג'אווהסקריפט, C++, רובי וראסט. המידע מחולק לעשרות אלפי קבצי ארכיון מכווצים, וכולל רק חלוקת אימון ללא פיצול מובנה לבדיקה.

כל רשומה מייצגת קובץ קוד בודד. היא מכילה את טקסט הקוד המלא, שם המאגר שממנו הוא נלקח, הנתיב של הקובץ בתוך המאגר, שפת התכנות שזוהתה לפי הסיומת, גודל הקובץ בבתים, וסוג הרישיון של המאגר המקורי מתוך 15 רישיונות שונים. הסינון הראשוני התבסס על סיומות הקבצים בלבד, ללא ניקוי איכות מעמיק מעבר לכך.

מתאים ל

  • אימון מודל להשלמת קוד

    אימון מודלי שפה על רצפי קוד במגוון שפות לפיתוח כלי השלמה אוטומטית.

  • מחקר על רישיונות קוד

    ניתוח התפלגות ושימוש ברישיונות תוכנה שונים במאגרי גיטהאב ציבוריים.

  • זיהוי שפות תכנות

    בניית מסווגים שמזהים שפת תכנות על בסיס טקסט הקוד ונתיב הקובץ.

איפה זה נופל

היוצרים מודים בפירוש שלא ביצעו שום סינון של פגיעויות אבטחה, באגים או קוד זדוני, ומודל שמתאמן עליו עלול ללמוד לייצר חולשות כאלה. בנוסף, לא נעשה שום ניקוי של מידע רגיש, ולכן קבצים יכולים להכיל מפתחות גישה, סיסמאות וכתובות אימייל שמפתחים העלו בטעות. מעבר לזה, השליפה בוצעה בפברואר 2022, כך שכל מה שנכתב מאז פשוט לא קיים כאן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

זה מסוכן. למרות שדף המאגר מוגדר תחת mit, הקבצים בפנים נאספו ממאגרים עם רישיונות שונים כמו GPL שמגבילים שימוש מסחרי. בנוסף היוצרים עצמם ציינו שהתכוונו להחיל עליו רישיון GPL-3.0, ולכן יש חוסר ודאות משפטית לגבי מודלים שאומנו עליו.

כמה שוקל הדאטהסט והאם אפשר להוריד אותו למחשב?

הוא שוקל בין 16 ל־18 טרה-בייט כשהוא פתוח ומכיל מעל 50,000 קבצים מכווצים. הורדה מלאה למחשב מקומי אינה מעשית לרוב המשתמשים. חובה לעבוד איתו בהזרמה דרך ספריית datasets.

האם יש בדאטהסט תמיכה בעברית?

המאגר מיועד לקוד תוכנה ולא לטקסט טבעי. שפות התכנות כוללות אנגלית כשפת בסיס, אך תיאורטית ייתכנו הערות בעברית בתוך קבצי קוד שנכתבו על ידי ישראלים. אין בו מיקוד או סינון מיוחד לעברית.

איך המידע נאסף והאם הוא מסונן?

הקבצים נשלפו ישירות מ־Google BigQuery מתוך מאגר גיטהאב הציבורי בתחילת 2022 לפי סיומות קבצים. לא נעשה סינון לאיכות הקוד, לבאגים, לפרצות אבטחה או למידע אישי וסודי שהודלף.

איך טוענים

גודל הדאטה במצב פתוח מגיע לכ־16 עד 18 טרה-בייט, עם יותר מחמישים אלף קבצים מכווצים בפורמט json.gz. אין צורך לבקש אישור גישה כדי להוריד אותו, אבל אסור לנסות להוריד הכל לדיסק מקומי רגיל. טוענים אותו ישירות דרך ספריית datasets באמצעות פרמטר streaming, ועוברים על הרשומות ברצף. השדות החשובים לעבודה הם code_text שמכיל את הקוד, ו־license כדי לסנן החוצה קוד ברישוי שלא מתאים לכם.

from datasets import load_dataset

ds = load_dataset("CodedotAI/code_clippy_github")

הרישיון

המאגר עצמו מסומן ברישיון mit, שמתיר שימוש מסחרי, שינוי והפצה תחת מתן ייחוס. עם זאת, היוצרים מציינים בטקסט כוונה להשתמש ב־GPL-3.0 ומזהירים שהדאטה מכיל קבצים מ־15 רישיונות מקוריים שונים, חלקם מגבילים כמו GPL. אימון מודל על קוד כזה חושף אתכם לסיכון משפטי, ויכול לחייב אתכם לחשוף את הקוד שלכם או להתאים לתנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗