GPT
C

codeparrot-clean

קוד פתוח

codeparrotרישיון לא דווח2022-03-02

  • python
  • code

קבצי פייתון מגיטהאב שעברו ניקוי כפילויות וסינון שורות. מתאים למי שרוצה לאמן מודל קוד בלי לשרוף שעות על שטיפת הדאטה המקורי.

  • 49,180הורדות בחודש
  • 89לייקים

מה זה

מדובר באוסף קוד פייתון שנאסף מגיטהאב והוא מהווה גרסה מסוננת ומנוקה של המאגר המקורי. המטרה כאן הייתה להעיף רעש וכפילויות מדויקות, ולכן הריצו עליו שרשרת סינונים מוגדרת. הקבצים שנשארו עמדו בכללים ברורים, כמו אורך שורה ממוצע שנמוך ממאה תווים ואורך שורה מקסימלי שלא חוצה את אלף התווים.

חוץ מזה, נזרקו קבצים עם מעט מדי תווים אלפאנומריים, מתחת לרבע מכלל התווים בקובץ, וסוננו קבצים שנוצרו אוטומטית לפי זיהוי מילות מפתח. המאגר עצמו מורכב ממעל חמישה מיליון קבצים, והיוצרים מציינים שיש חלוקה לסט אימון ולסט ולידציה שיושבים במאגרים נפרדים, מה שמקל על מי שרוצה להריץ עבודה מסודרת בלי להמציא מחדש חלוקת נתונים.

מתאים ל

  • אימון מודל שפה לפייתון

    בסיס נקי ומוכן לאימון מקדים של מודלים שמיועדים להשלמת קוד פייתון.

  • הערכת ביצועי מודלים

    בדיקת איכות של מודלים קיימים מול סט הוולידציה המופרד של המאגר.

  • ניתוח סטטיסטי של קוד

    מחקר על דפוסי כתיבה בפייתון בעזרת השדות המוכנים של אורכי השורות והתווים.

איפה זה נופל

החומר מתבסס כולו על פייתון ומגיע מגיטהאב בלבד, כך ששפות אחרות בכלל לא קיימות כאן. הסינון האוטומטי זרק קבצים עם שורות ארוכות או יחס תווים נמוך, מה שעלול להעיף גם קבצי הגדרות תקינים, בדיקות מורכבות או מבני נתונים לגיטימיים שהוטמעו בקוד. בנוסף, הדאטה פורסם במרץ 2022 ולא עודכן מאז, כך שפיצ'רים חדשים של השפה ושיטות כתיבה עדכניות פשוט נעדרים ממנו.

שאלות
נפוצות

מותר להשתמש במאגר לפרויקט מסחרי?

לא דווח רישיון כללי למאגר עצמו, מה שאומר שאין היתר גורף. עם זאת, לכל רשומה יש שדה רישיון שמציין את תנאי הקוד המקורי מגיטהאב. מי שבונה מודל מסחרי יצטרך לבודד רק קבצים עם רישיונות מתאימים כמו אפאצ'י או אם איי טי.

כמה מקום המאגר תופס בדיסק?

המאגר כולל כחמישים גיגה בייט של קוד. הוא מחולק לחמישים ושבעה קבצי json דחוסים, ויש בו מעל חמישה מיליון קבצים, כך שצריך להיערך לנפח הזה בזמן הפריקה והעיבוד.

האם יש במאגר תמיכה או קוד בעברית?

המאגר מיועד לקוד פייתון בלבד ומקורו במאגרי גיטהאב גלובליים. אם יש עברית, היא תופיע לכל היותר בהערות או במחרוזות פנימיות שנכתבו במקרה על ידי מפתחים ישראלים, אך אין שום סינון או כוונה כזו.

מה ההבדל בינו לבין המאגר המקורי של קודפארוט?

המאגר הזה עבר הסרת כפילויות מלאה של קבצים זהים וניקוי של קוד שנוצר אוטומטית. בנוסף הוסרו ממנו קבצים עם שורות ארוכות מדי או יחס נמוך של תווים אלפאנומריים, כדי שהדאטה יהיה איכותי יותר לאימון.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה באמצעות המזהה של המאגר. אין פה שום דרישה לאישור גישה, הכל פתוח להורדה ישירה. בפועל מדובר בכחמישים גיגה בייט של קוד שנשמרים כחמישים ושבעה קבצי json דחוסים, אז כדאי לוודא שיש לכם מספיק שטח אחסון פנוי ורוחב פס סביר לפני שמתחילים להוריד.

בתוך כל רשומה תמצאו שדות שימושיים כמו תוכן הקובץ המלא, שם המאגר והנתיב, לצד שדות מטריקה שנוצרו בסינון כמו אורך שורה ממוצע ומקסימלי ושיעור התווים. כדאי לשים לב לשדה הרישיון שמופיע בכל שורה אם אתם בררנים לגבי המקורות של הקוד שנכנס למודל.

from datasets import load_dataset

ds = load_dataset("codeparrot/codeparrot-clean")

הרישיון

למאגר עצמו לא דווח רישיון רשמי בעמוד. בפועל, כל קובץ קוד בתוכו הגיע מפרויקט גיטהאב אחר ויש שדה רישיון ברמת הרשומה. בלי רישיון כולל ברור למאגר, שימוש מסחרי במודל שמאומן עליו יוצר סיכון משפטי, ותצטרכו לסנן בעצמכם את הקבצים לפי שדה הרישיון הפרטני שלהם.

הרישיון המלא ב־Hugging Face ↗