GPT
T

Tested-143k-Python-Alpaca

קוד פתוח

Vezoraapache-2.02024-03-06

מאגר הוראות פייתון שבו כל קטע קוד נבדק והורץ בפועל כדי לוודא שאינו שבור. מתאים למי שרוצה לאמן מודל בלי להאכיל אותו בשגיאות תחביר או בספריות חסרות.

  • 6,503הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל קוד פייתון בפורמט Alpaca שנאסף ממקורות פתוחים מוכרים, ביניהם WizardLM Evol, CodeUp 19k, Code Alpaca, Dolphin וערכות הנתונים של Magicoder, לצד שאלות שנכתבו ידנית עבור GPT 4. כל הדוגמאות עברו ניקוי כפילויות לפני שלב הסינון.

הייחוד כאן הוא שיטת הסינון. היוצרים פיתחו סקריפט שחילץ את הקוד מתוך שדה התשובה והריץ אותו בסביבת פייתון אמיתית. קטעים שעברו בהצלחה נשמרו, בעוד שאלפי קטעים שנכשלו בגלל שגיאות מודולים או בעיות הרצה אחרות נזרקו החוצה.

התוצאה היא קובץ מרכזי יחיד שמחזיק מעל מאה וארבעים אלף דוגמאות של הוראות ותשובות עובדות. אין כאן חלוקה מובנית לסט אימון ובדיקה, והקוד כולו נשמר במבנה אחיד של הוראה ותוצאה מוכנה לעבודה.

מתאים ל

  • אימון הוראות לפייתון

    אימון מודלי שפה על קוד פייתון שנבדק והוכח כרץ, כדי להפחית יצירת קוד עם שגיאות תחביר.

  • סינון דאטהסטים קיימים

    שימוש במתודולוגיה ובנתונים כבסיס להשוואה וניקוי של מאגרי קוד פתוחים אחרים.

  • בניית מודלי תגמול

    שימוש בדוגמאות התקינות לצד דוגמאות שבורות ממאגרים מקבילים לצורך אימון מודלים בשיטת DPO.

איפה זה נופל

הסינון בודק שהקוד רץ, אך לא שהוא מעודכן. הכרטיס מציין במפורש שחלק מהקוד שמודלי שפה מייצרים נשען על קריאות ותיעוד ישנים, כך שייתכנו פונקציות מיושנות. אין כאן עברית, הכל באנגלית ובפייתון בלבד. בנוסף, בדיקת ההרצה הסתמכה על ספריות שהיו מותקנות בסביבה מקומית כמו tkinter, מה שעלול להשאיר תלות בחבילות ספציפיות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache 2.0 שמתיר שימוש מסחרי מלא. היוצרים מבקשים רק להוסיף ייחוס בנוסח Filtered Using Vezora's CodeTester בריפו של המודל שלכם.

האם יש במאגר דוגמאות או הוראות בעברית?

לא, המאגר מורכב כולו מהוראות וקוד באנגלית שנאספו ממאגרי קוד בינלאומיים כמו Dolphin ו־Magicoder. אין בו שום תוכן מקומי או תמיכה ייעודית בעברית.

מה ההבדל בינו לבין Code Alpaca המקורי?

בדאטהסטים מקוריים יש אלפי קטעי קוד שלא מתקמפלים או נכשלים בהרצה עקב שגיאות מודולים. כאן כל קטע קוד הורץ בפועל בסביבת פייתון, ורק מה שעבר בהצלחה נשמר במאגר הסופי.

איך הדאטהסט הזה נאסף בפועל?

היוצרים אספו נתונים ממאגרים פתוחים שונים כמו Evol של WizardLM ודוגמאות מ־GPT 4, וניקו כפילויות. לאחר מכן הריצו סקריפט שבדק כל קטע קוד מקומית ושמר רק את אלה שפעלו ללא שגיאות.

איך טוענים

הקובץ המרכזי שמור כקובץ JSON יחיד בשם 143k-Tested-Python-Alpaca-Vezora.json ופתוח להורדה ישירה ללא צורך באישור גישה. המבנה עוקב אחרי סכמת Alpaca הסטנדרטית, כך שצריך להתמקד בשדות ההוראה והפלט בעת טעינת הנתונים לאימון. כדאי לפצל ידנית חלק מהדוגמאות לטובת סט ולידציה, מאחר שהמאגר מגיע כיחידה אחת.

from datasets import load_dataset

ds = load_dataset("Vezora/Tested-143k-Python-Alpaca")

הרישיון

המאגר מופץ תחת רישיון apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף באותו רישיון. המשמעות היא שניתן לאמן עליו מודלים מסחריים. היוצרים מבקשים לתת קרדיט באמצעות הניסוח Filtered Using Vezora's CodeTester במאגר המודל או הנתונים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗