GPT
C

code-act

קוד פתוח

xingyaowwapache-2.02024-01-15

  • llm-agent
  • llm
  • instruction-tuning

אינטראקציות רב שלביות של סוכני קוד מבוססי פייתון במקום קריאות ג'ייסון רגילות. המאגר נבנה כדי לאמן מודלים לפעול בסביבת פיתוח אמיתית ולתקן שגיאות תוך כדי ריצה.

  • 553הורדות בחודש
  • 76לייקים

מה זה

המאגר מכיל כ־7,000 אינטראקציות רב שלביות תחת השם CodeActInstruct, שנועדו לכוונון הוראות של סוכני שפה. במקום לייצר פקודות בטקסט חופשי או במבנה JSON, כל רשומה מייצגת פעולות שנכתבות כקוד פייתון להרצה, לצד התוצאות שחוזרות מהאינטרפרטר והמשך השיחה שמתקן פעולות קודמות על סמך הפלט שהתקבל.

מבנה הקבצים מראה חלוקה ברורה. יש כאן קובץ שמכיל את אינטראקציות הקוד הייעודיות, וקובץ נפרד שמכיל שיחות כלליות יותר. המטרה של השילוב הזה היא לאפשר אימון של סוכן שמסוגל לפתור בעיות תכנות מורכבות בלי לאבד את יכולות השיחה והידע הכללי שלו.

מתאים ל

  • אימון סוכני פייתון

    כוונון מודלי שפה פתוחים להרצת קוד ותיקון עצמי בלולאה רב שלבית מול אינטרפרטר.

  • הערכת ביצועי סוכנים

    בדיקת יכולת המודל לייצר קוד פעיל במקום פלטי JSON סטנדרטיים מול כלי מערכת.

  • שימור יכולות שיחה

    אימון משולב שמלמד ביצוע משימות קוד מבלי לפגוע ביכולת ניהול שיחה כללית.

איפה זה נופל

המאגר כולו באנגלית בלבד. אם אתם בונים כלי שמיועד להבין הוראות בעברית או לתקשר עם משתמשים מקומיים, הנתונים האלה לא יעזרו לכם בלי תרגום או אימון נוסף. בנוסף, מדובר במאגר קטן יחסית של כ־7,000 דוגמאות בלבד. כרטיס המאגר לא מפרט אילו ספריות פייתון מכוסות כאן, מאיפה הגיעו המשימות המקוריות, או איך נופו שגיאות אבטחה ופקודות שעלולות להיות מסוכנות לסביבת הריצה שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים או מוצרים שנמכרים ללקוחות. התנאי היחיד הוא שמירה על תנאי הרישיון ומתן ייחוס ליוצרים.

האם המאגר כולל תמיכה בעברית?

לא, הנתונים קיימים באנגלית בלבד. כל ההוראות, השיחות, והקוד כתובים באנגלית, כך שתידרש התאמה ידנית אם הממשק שלכם דורש עברית.

כמה מקום המאגר תופס והאם קשה להוריד אותו?

מדובר במאגר קטן מאוד של פחות מעשרת אלפים רשומות שמחולק לשני קובצי parquet. ההורדה מהירה ביותר ואינה דורשת משאבי אחסון מיוחדים.

מה ההבדל בין המאגר הזה למאגרי סוכנים מבוססי JSON?

כאן הסוכן לומד לכתוב קוד פייתון ישיר שרץ במערכת במקום מבני נתונים סטטיים. זה מאפשר לו לקבל משוב חי מהאינטרפרטר ולתקן טעויות בזמן אמת.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות מזהה המאגר. המאגר פתוח לחלוטין לגישה ציבורית ולא דורש אישור מוקדם או מפתחות גישה. כל המידע שמור בשני קובצי פא ascend קלים בפורמט parquet, מה שאומר שההורדה והטעינה לוקחות שניות ספורות גם על מחשב נייד רגיל. בעבודה איתו צריך לשים לב לרצף ההודעות הרב שלבי, שמחזיק את הקוד, פלט ההרצה, ותגובות המשתמש ברצף כרונולוגי.

from datasets import load_dataset

ds = load_dataset("xingyaoww/code-act")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הנתונים, ושילוב שלהם בפרויקטים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון. מודלים שתאמנו על הנתונים האלה אינם מחויבים להיפתח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗