GPT
T

Tested-22k-Python-Alpaca

קוד פתוח

Vezoraapache-2.02023-11-03

מאגר של 22,600 הוראות פייתון בפורמט אלפקה שעברו הרצה מקומית ואימות בפועל. מי שמחפש אותו רוצה להעיף קוד שבור מאימון מודלי קוד בלי לסנן הכל לבד.

  • 1,825הורדות בחודש
  • 67לייקים

מה זה

היוצרים אספו דוגמאות ממאגרים מוכרים כמו Evol של WizardLM, הדאטהסט של CodeUp, קוד אלפקה של Sahils2801, דולפין של Eric Hartford ושאלות קוד שנכתבו ידנית מול GPT 4. הם זיהו שמאגרי קוד פתוח רבים מכילים אלפי דוגמאות שבורות עם שגיאות מודולים, ולכן פיתחו סקריפט שמחלץ את הקוד מחלק ה־output, מריץ אותו מקומית על המחשב, ושומר רק את מה שעובר בהצלחה.

הרשומות בנויות במבנה אלפקה של הוראה ותוצאה, ועברו ניקוי כפילויות. למרות שבמאגר יש קובץ ששמו כולל את המספר 188k, היוצרים מסבירים שמדובר בטעות ספירה של סקריפט ישן, ובפועל יש בו כ־22,600 דוגמאות של פייתון בלבד שעברו אימות והרצה.

מתאים ל

  • אימון הוראות לקוד

    כוונון עדין של מודלי שפה על דוגמאות פייתון תקינות שנבדקו בהרצה ולא מייצרות שגיאות תחביר בסיסיות.

  • סינון דאטהסטים קיימים

    שימוש בסקריפטים המצורפים כדי להריץ, לבדוק ולנקות קוד שבור מתוך מאגרים אחרים שלכם.

  • בניית זוגות ל־DPO

    הפרדה בין הקוד התקין לקוד שנכשל באמצעות הכלים המצורפים כדי לייצר דאטה לאימון העדפה.

איפה זה נופל

המאגר מוגבל אך ורק לפייתון ואין בו נתוני קוד בשפות אחרות או הנחיות בעברית. יוצרי המאגר מציינים בעצמם שמודלי בסיס שכותבים קוד תקין תחבירית עדיין סובלים ממחסור בתיעוד עדכני, ולכן הקוד עשוי לכלול קריאות ל־API ופונקציות ישנות. בנוסף, העובדה שקוד רץ בהצלחה אינה מבטיחה שהוא אופטימלי, מאובטח או פותר בדיוק את מה שהתבקש בהוראה.

שאלות
נפוצות

האם מותר להשתמש במאגר כדי לאמן מודל מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא באימון ובהפצה. היוצרים מבקשים להוסיף ייחוס בנוסח Filtered Using Vezora's CodeTester בתיעוד של כל פרויקט או מודל שמשתמש בנתונים.

כמה דוגמאות יש בפועל ומדוע הקובץ נקרא 188k?

בדאטהסט יש 22,600 דוגמאות קוד שנבדקו. השם 188k נובע מטעות בסקריפט הספירה המקורי של המפתחים, שלא ידע לקרוא נכון את מבנה האלפקה וספר רשומות שלא לצורך.

האם הדאטהסט כולל שפות תכנות נוספות או עברית?

לא. המאגר מכיל אך ורק קוד פייתון וההנחיות בו כתובות באנגלית. אם אתם מחפשים שפות פיתוח אחרות או תמיכה בהוראות בעברית, המאגר הזה לא יתאים.

מה ההבדל בינו לבין Code Alpaca המקורי?

המאגר המקורי הכיל אלפי שגיאות הרצה, מודולים חסרים וקוד שלא עובד כלל. כאן כל שורת קוד בפלט עברה הרצה אמיתית ומקומית, ונשמרו רק דוגמאות שהסתיימו בהצלחה ללא שגיאות.

איך טוענים

הנתונים יושבים בקובץ JSON במבנה אלפקה סטנדרטי לצד סקריפטי הבדיקה בפייתון, כך שלא צריך שום אישור גישה מיוחד כדי להוריד אותו. השדות החשובים הם ההוראה והקוד שנמצא בפלט. קחו בחשבון שאם תבחרו להריץ את סקריפטי הסינון המצורפים על דאטהסטים אחרים, הם מריצים קוד מקומית בריבוי תהליכים, וזה דורש התקנת ספריות כמו tkinter וסביבה מבודדת כדי לא לחטוף קוד מזיק ישירות למערכת ההפעלה.

from datasets import load_dataset

ds = load_dataset("Vezora/Tested-22k-Python-Alpaca")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן עליו מודלים מסחריים בלי לחייב אתכם לפתוח את הקוד שלכם. הדרישה העיקרית היא שמירת הודעת הרישיון המקורית, ובנוסף היוצרים מבקשים במפורש לתת קרדיט ולציין בתיעוד המודל או המאגר שלכם את המשפט Filtered Using Vezora's CodeTester.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗