GPT
C

code-search-net-python

קוד פתוח

Nan-Doapache-2.02023-05-14

  • code
  • python
  • CodeSearchNet

המאגר מרכז פונקציות פייתון מגיטהאב עם תיאורים קצרים שנוצרו במודל סיכום. הוא מיועד למי שרוצה לאמן מודלים על קוד מתועד בלי לעבוד קשה על חילוץ טקסט.

  • 4,410הורדות בחודש
  • 30לייקים

מה זה

הבסיס כאן הוא חלק הפייתון מתוך CodeSearchNet המקורי, שמכיל פונקציות קוד פתוח עם ההערות המקוריות שנכתבו בגיטהאב. מה שנוסף פה זו עמודת סיכום, שמתארת בקצרה מה כל פונקציה עושה.

הסיכומים לא נכתבו בידי בני אדם אלא הופקו באמצעות מודלי סיכום T5 של חברת Salesforce. היוצר ציין שהנתונים עברו סינון מסוים כדי להסיר חזרות ותיאורים חסרי משמעות, אך הוא לא פירט מדדים מדויקים או כללי סף טכניים.

אין כאן קבצים נפרדים לחלוקות השונות. במקום פיצול פיזי, החלוקה לאימון, בדיקה ואימות מופיעה ישירות כערך בעמודה ייעודית בתוך הטבלה.

מתאים ל

  • אימון מודלי תיעוד קוד

    יצירת מודלים שמקבלים פונקציית פייתון ומייצרים לה תיאור תמציתי באנגלית באופן אוטומטי.

  • בניית דאטהסט הוראות

    שימוש בזוגות של פונקציה וסיכום כדי להרכיב פרומפטים לאימון מודלי שפה על משימות תכנות.

  • חיפוש קוד סמנטי

    אימון מערכות שמאתרות קטעי קוד מתוך תיאור טקסטואלי חופשי של הפעולה שהם מבצעים.

איפה זה נופל

הסיכומים נוצרו במודל T5 של Salesforce ולא עברו ולידציה אנושית מלאה. היוצר מודה במפורש שחלק מהתיאורים חסרי משמעות או כוללים חזרות שנשארו בפנים למרות הסינון. בנוסף, כל התיעוד וההערות כתובים באנגלית בלבד. אין כאן שום תמיכה בעברית, והקוד מוגבל לפייתון בלבד ללא שפות תכנות נוספות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, המאגר מסומן ברישיון apache-2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או כאלה שמוצעים ללקוחות בתשלום. חובה רק לשמור על תנאי הייחוס והרישיון המקורי בקוד או בהפצה שלכם.

האם יש בדאטהסט נתונים או תיאורים בעברית?

לא, אין כאן עברית בכלל. הקוד שנאסף מגיטהאב מכיל הערות באנגלית, וגם עמודת הסיכום שהופקה בעזרת מודל T5 היא באנגלית בלבד. אם אתם מחפשים קוד עם הסברים בעברית תצטרכו לתרגם את הנתונים בעצמכם.

מאיפה הגיעו הנתונים ומי יצר את הסיכומים?

מקור הקוד הוא חלק הפייתון ממאגר CodeSearchNet שחולץ מפרויקטים בקוד פתוח בגיטהאב. עמודת הסיכום נוצרה במאי 2023 באמצעות מודלי T5 מבית Salesforce. היוצר ניקה חלק מהפלט, אך הסיכומים עצמם ממוחשבים ולא נכתבו בידי מפתחים.

באיזה פורמט המידע שמור ואיך ניגשים לחלוקות?

המידע מחולק לארבעה קבצי Parquet תחת תיקיית המידע של המאגר. אין קבצים נפרדים לחלוקות של אימון או בדיקה, אלא עמודה ייעודית שמציינת לאיזה חלק כל רשומה שייכת. בטעינה צריך לסנן את השורות לפי הערך בעמודה זו.

איך טוענים

המאגר פתוח לציבור ואין צורך לבקש אישור גישה מיוחד כדי להוריד אותו. הנתונים שמורים בארבעה קבצי Parquet שמכילים את נתוני האימון לצד קובץ תיעוד. כדי להשתמש בפיצולים המקובלים של בדיקה או אימות תצטרכו לפלטר את הנתונים לפי עמודת התוויות שבתוך הקובץ, במקום לטעון ספליט מובנה מהספרייה.

from datasets import load_dataset

ds = load_dataset("Nan-Do/code-search-net-python")

הרישיון

המאגר מפורסם ברישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה, ומותר לאמן עליו מודלים מסחריים. התנאי המרכזי הוא מתן קרדיט ושמירה על הודעת הרישיון המקורית של הפרויקט, ללא דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗