GPT
S

SWE-ZERO-12M-trajectories

קוד פתוח

AlienKevinapache-2.02026-04-16

  • swe-zero
  • code
  • agentic
  • pre-training

המאגר מרכז מעל 12 מיליון מסלולי ריצה של סוכן קוד אוטונומי, בהיקף של 112 מיליארד טוקנים. הוא מיועד למי שרוצה לאמן מודל בסיס על ניווט במערכות קבצים בלי לתחזק אלפי סביבות דוקר.

  • 6,499הורדות בחודש
  • 129לייקים

מה זה

כל רשומה מייצגת מסלול של סוכן פתרון תקלות, שנלקח מתוך מאגר משימות המבוסס על בקשות משיכה אמיתיות בגיטהאב. הנתונים מכסים 122,908 בקשות משיכה מתוך 3,222 מאגרים שונים וב־16 שפות תכנות. המודל שייצר את המסלולים הוא mini-coder-1.7b, כאשר מכל משימה נדגמו 100 ריצות עצמאיות בטמפרטורה 1.0.

המבנה של כל רשומה כולל מזהה משימה, שם המאגר, שדה הודעות בפורמט של שיחה רב שלבית, סטטוס סיום, פורמט המסלול וזמן הריצה בשניות. בכל שלב הסוכן מפיק פקודת מעטפת אחת והסביבה מחזירה את הפלט שלה, כאשר המגבלה עומדת על 15 שלבים לכל היותר ועד 32,768 טוקנים לרשומה.

הייחוד בשיטת האיסוף הוא היעדר הרצה של בדיקות יחידה, קומפילציה או פקודות ספציפיות לפרויקטים. הסוכן הונחה להשתמש בפקודות מערכת רגילות בלבד כמו חיפוש טקסט וקריאת קבצים, ללא סינון לפי הצלחת התיקון, מה שאפשר להרחיב את המאגר פי כמה ממאגרים קודמים.

מתאים ל

  • אימון אמצע למודלי שפה

    הקניית הרגלי עבודה בסיסיים של שימוש בפקודות מעטפת וקריאת קבצים לפני שלב הכוונון העדין.

  • אימון ראשוני לסוכני קוד

    לימוד המודל לחקור מאגר קוד באמצעות פקודות חיפוש בלי להסתמך על סביבות הרצה מותקנות מראש.

  • מחקר על דגימת מסלולים

    ניתוח מגוון הפעולות של מודלים קטנים על בסיס השוואה בין 100 ניסיונות שונים לאותה משימה.

איפה זה נופל

המאגר לא מתאים לאימון כוונון עדין ישיר למשימות קוד, אלא לשלב אימון האמצע. הנקודה הקריטית היא שאין פה שום אימות. אף מסלול לא נבדק מול בדיקות תוכנה אמיתיות, ולא ידוע אם הקוד בכלל מתקמפל או עובד. רוב הריצות נחתכות באמצע בגלל הגבלת 15 הצעדים ומסתיימות בסטטוס לא שלם.

אם תסננו רק ריצות שהגיעו להגשה נקייה, תאבדו את רוב המאגר. בנוסף, הנתונים מתועדים באנגלית ומכסים 16 שפות תכנות בלבד, ללא שום תמיכה או התייחסות לעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא אפאצ'י 2.0 והוא מתיר שימוש מסחרי מלא. צריך רק לשמור על תנאי הייחוס והודעת הרישיון המקורית. מודלים שתאמנו על המידע הזה יכולים לשמש במוצרים סגורים.

האם הדאטהסט כולל קוד או הוראות בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. המשימות מבוססות על מאגרי קוד בינלאומיים ב־16 שפות תכנות שונות. שמות הקבצים, תוכן הקוד והודעות הסוכן כולם באנגלית.

במה הוא שונה ממאגרי סוכנים קודמים?

הוא גדול בערך פי חמישה ממאגרי סוכנים קודמים וכולל 111.06 מיליארד טוקנים. ההבדל המרכזי הוא שהוא נבנה בלי להריץ קונטיינרים או לבדוק שהקוד עובד, מה שאפשר לייצר כמות עצומה של נתונים על פני אלפי מאגרים.

האם המסלולים מכילים פתרונות נכונים לתקלות?

אין שום ערובה לכך, ובחלק גדול מהמקרים התשובה היא לא. המודל שייצר את המסלולים הוגבל ל־15 צעדים ולא הריץ טסטים לבדיקת הפתרון שלו. המטרה היא ללמד מודלים איך לגשת לקבצים ולהריץ פקודות, לא לחקות פתרון סופי מושלם.

איך טוענים

הנתונים מחולקים ל־1,233 קבצים, מתוכם קובצי טבלאות בפורמט פארקט תחת תיקיית המידע. הגישה למאגר חופשית ואינה דורשת אישור מוקדם. השדות המרכזיים לעיבוד הם messages, שמכיל את רצף הפעולות והתגובות של הסוכן, ו־instance_id לזיהוי המשימה. בגלל שמדובר ב־111.06 מיליארד טוקנים ומיליוני רשומות, טעינה מלאה לזיכרון דורשת הזרמת נתונים או חלוקה מראש למקטעים לפי שמות הקבצים.

from datasets import load_dataset

ds = load_dataset("AlienKevin/SWE-ZERO-12M-trajectories")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון. משמעות הדבר היא שמותר לאמן מודלים על הנתונים הללו ולשלב אותם במוצרים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗