GPT
C

cornstack-python-v1

קוד פתוח

nomic-aiapache-2.02024-12-06

מאגר של שלשות פייתון שנועד לאימון מודלים של חיפוש קוד ושליפה. הוא נבנה כדי לספק דוגמאות איכותיות עם שליליים קשים מתוך קוד אמיתי.

  • 23,644הורדות בחודש
  • 28לייקים

מה זה

הנתונים מבוססים על גרסה ללא כפילויות של Stackv2, שממנה חולצו זוגות של תיעוד ופונקציות פייתון תואמות. המפתחים ניקו החוצה תיעוד שאינו באנגלית, טקסטים קצרים מדי, קישורים, תגיות HTML ותווים לא תקינים. בנוסף, הם שמרו במכוון תיעוד באורך של 256 טוקנים ומעלה כדי לאפשר למודלים ללמוד הקשרים ארוכים.

לאחר הסינון הראשוני הופעל סינון עקביות כפול, שבו נוצרו שיכונים לקוד ולתיעוד. זוג שבו הקוד לא הופיע בין שתי התוצאות הדומות ביותר לתיעוד שלו נזרק מהמאגר. הרשומות הסופיות בנויות במבנה של שלשות שכוללות שאילתה, תוצאה חיובית ותוצאה שלילית, שנבחרה בשיטת כרייה של שליליים קשים ברמת קושי עולה.

מתאים ל

  • אימון מודלי שיכון לקוד

    לימוד ייצוג וקטורי של פונקציות פייתון והתיעוד שלהן עבור מנועי חיפוש סמנטי.

  • אימון מודלי דירוג מחדש

    התאמת מודלים למיון תוצאות חיפוש קוד בעזרת דוגמאות שליליות קשות.

  • בדיקת איכות של שליפת קוד

    הערכת היכולת של מערכות קיימות להתאים בין שאילתות ארוכות למימושי פייתון.

איפה זה נופל

הטקסטים מסוננים מראש לאנגלית בלבד, כך שאין כאן שום תמיכה בשאילתות בעברית או בהערות קוד בשפות אחרות. המיקוד הוא אך ורק בפייתון, ולכן המאגר לא יסייע בפיתוח מודלים לשפות תכנות אחרות. בנוסף, בגלל הדרישה לתיעוד באורך של לפחות 256 טוקנים, חסרות כאן פונקציות קצרות ופשוטות שנפוצות מאוד בקוד יומיומי. אם המערכת שלכם צריכה לחפש סקריפטים קטנים לפי שאילתות קצרות, הפיזור פה מוטה לקטעים ארוכים ומורכבים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מוצרים שנמכרים ללקוחות, כל עוד אתם שומרים על תנאי הייחוס של הרישיון.

האם המאגר כולל שאילתות או קוד בעברית?

לא. תהליך הסינון של יוצרי המאגר הסיר במפורש כל תיעוד שאינו באנגלית, והקוד עצמו כתוב בפייתון בלבד.

מאיפה הגיעו הנתונים ואיך הם עובדו?

הנתונים נלקחו מגרסה ללא כפילויות של Stackv2. הם עברו סינון להסרת טקסטים קצרים, תגיות אינטרנט ושגיאות, ולאחר מכן עברו סינון עקביות לפי דמיון וקטורי כדי להשאיר רק התאמות הדוקות.

איך טוענים

המאגר מחולק לקבצי jsonl דחוסים בפורמט gz, בסך הכל 242 קבצים בעמוד המאגר. הגישה אליו חופשית לחלוטין ואין צורך בהרשאת גישה מיוחדת או באישור ידני. כל שורה מכילה שאילתה, קטע קוד חיובי וקטע קוד שלילי, כך שצריך לפרוק את הקבצים ולקרוא אותם ישירות לתוך צינור האימון שלכם.

from datasets import load_dataset

ds = load_dataset("nomic-ai/cornstack-python-v1")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה ללא תשלום תמלוגים. מותר לאמן עליו מודלים מסחריים בלי חובה לחשוף את קוד המקור או לשחרר את המשקולות באותו רישיון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗