GPT
P

python-codes-25k

קוד פתוח

flytechרישיון לא דווח2023-10-30

  • code
  • python
  • flytech
  • cleaned
  • instructional

המאגר מרכז קרוב ל־25 אלף משימות פייתון במבנה הוראה וקוד. הוא מתאים למי שמחפש סט קומפקטי ומובנה לאימון מודלי שפה לכתיבת קוד.

  • 10,667הורדות בחודש
  • 182לייקים

מה זה

הנתונים מחולקים לארבעה שדות: הוראה לביצוע, שדה קלט שלרוב מכיל פתיח קצר של מודל או נשאר ריק, פלט שמכיל את קוד הפייתון שמבצע את המשימה, ושדה טקסט שמאחד את כולם יחד. המאגר כולל 24,813 רשומות עם ממוצע של 508 תוקנים לדוגמה אחת.

הכרטיס מגדיר את המידע כגרסה נקייה של משימות פייתון, אך הוא אינו מפרט מהיכן נאספו הנתונים במקור או באילו תהליכי סינון השתמשו בפועל כדי לנקות אותם. בנוסף, המפרסם מציין שהמאגר קיים גם בפלטפורמת קגל תחת אותו שם אך תחת מחבר אחר.

מתאים ל

  • אימון מודלים לכתיבת קוד

    כוונון עדין של מודלי שפה קטנים או בינוניים למשימות יצירת קוד פייתון לפי הוראות משתמש.

  • הבנת שפה טבעית בקוד

    מיפוי הוראות מילוליות למבני קוד תואמים לצורך ניתוח כוונות משתמש בסביבות פיתוח.

  • ניתוח התנהגות מודלים

    בדיקת האופן שבו מודלים שונים מגיבים למגוון של מעל 24 אלף משימות תכנות שונות.

איפה זה נופל

הבעיה המרכזית היא היעדר מידע על מקור הנתונים. לא ידוע מאיזה מודל או מאגר קוד הם נלקחו, מה שמשאיר שאלות פתוחות לגבי איכות הקוד, אבטחה וספריות מיושנות. כלל התוכן נשען על השפה האנגלית בלבד, ואין פה ייצוג לעברית. בנוסף, קיימת סתירה במטא-דאטה של הדף שמציג סדר גודל של מעל מיליון רשומות, בעוד שבפועל יש פחות מ־25 אלף דוגמאות בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

בגוף הכרטיס מוגדר רישיון MIT שמאפשר שימוש מסחרי, אך שדה הרישיון הראשי בדף נותר ריק. כדאי לקחת בחשבון את חוסר הבהירות הזו, בעיקר אם המוצר שלכם דורש שקיפות משפטית מלאה לגבי מקורות המידע.

כמה רשומות יש במאגר בפועל?

בניגוד לתגית הכללית של Hugging Face שמציינת מעל מיליון פריטים, המאגר כולל 24,813 רשומות בדיוק. קיימת גם אזהרה לבדוק שטעינת הקבצים לא מייצרת כפילות שגויה של 50 אלף רשומות עקב הימצאות שני פורמטים של הקובץ.

האם יש במאגר משימות או תיאורים בעברית?

לא, כל ההוראות, הקלטים והקוד כתובים באנגלית בלבד. אם המטרה היא תמיכה בפקודות בעברית, תצטרכו לתרגם את שדה ההוראות באופן עצמאי.

מאיפה נאספו נתוני הפייתון?

הכרטיס אינו מספק מידע על מקור האיסוף, שיטות הניקוי או זהות המחברים המקוריים. המפרסם רק מציין שהדאטהסט קיים גם בקגל תחת מחבר אחר, ללא קישור או פירוט נוסף.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets של Hugging Face ללא צורך באישור גישה מיוחד. הקבצים זמינים בפורמטים json ו־jsonl, וחשוב לוודא בזמן הטעינה שהספרייה אינה סופרת את שני הקבצים בטעות כמאגר כפול של כמעט 50 אלף דוגמאות. השדות המרכזיים לעבודה הם instruction ו־output, או שימוש ישיר בשדה text שכבר מחבר אותם יחד.

from datasets import load_dataset

ds = load_dataset("flytech/python-codes-25k")

הרישיון

במטא-דאטה הרשמי של הדף לא מוגדר רישיון, אך בגוף כרטיס המאגר המפרסם מציין במפורש רישיון MIT. הפער הזה עלול ליצור אי-ודאות משפטית. אם מסתמכים על MIT, השימוש המסחרי מותר לחלוטין לצד דרישת ייחוס, אך כדאי לבדוק את מקור הנתונים המקורי לפני שמשלבים תוצרים של מודל כזה במערכות ארגוניות.

הרישיון המלא ב־Hugging Face ↗