GPT
S

SWE-smith-trajectories

קוד פתוח

SWE-benchmit2025-04-29

  • code
  • agents
  • software-engineering

המאגר מרכז 5,017 מסלולי ריצה מלאים של סוכן קוד שניסה לפתור משימות תכנות אמיתיות. הוא מיועד למי שרוצה לאמן מודלים לפיתוח תוכנה על בסיס צעדי עבודה מוצלחים.

  • 11,446הורדות בחודש
  • 78לייקים

מה זה

המאגר כולל 5,017 מסלולי פתרון ששימשו לאימון המודל SWE-agent-LM-32B, שהגיע לתוצאה של 40.2 אחוזים במבחן SWE-bench Verified בניסיון בודד ללא מנגנוני אימות נוספים. כל רשומה מייצגת שרשרת פעולות שלמה, החל מקבלת הבעיה ועד הניסיון לפתור אותה בסביבת הפיתוח.

המסלולים נוצרו מריצה של הכלי SWE-agent יחד עם המודל Claude 3.7 Sonnet מול בעיות שנלקחו מתוך המאגר הרחב יותר SWE-smith. במקום נתוני קוד יבשים, מקבלים כאן תיעוד של סוכן חכם שבודק קבצים, מריץ פקודות ומתקן שגיאות תוך כדי תנועה, מה שמאפשר ללמוד איך מודל חזק ניגש לדיבאגינג.

הקבצים במאגר מחולקים למקטעי פרקט שונים, ללא חלוקה מפורשת לסט אימון ובדיקה נפרדים בכרטיס עצמו. התיעוד ממוקד כולו במשימות שהגיעו ממאגר המקור, והנתונים משקפים רק את הריצות שבוצעו עם המודל של אנתרופיק לצורך הכנת מודל הקוד הייעודי.

מתאים ל

  • אימון סוכני קוד

    אימון עדין של מודלי שפה כדי שילמדו לפתור באגים מורכבים ברצף פעולות נכון.

  • ניתוח התנהגות סוכנים

    מחקר על אופן קבלת ההחלטות ושימוש בכלים של קלוד בסביבות פיתוח מורכבות.

  • זיקוק מודלים קטנים

    העברת יכולות הסקת מסקנות מתקדמות ממודל קוד גדול למודלים קומפקטיים וזולים.

איפה זה נופל

ההטיה המרכזית נובעת מכך שכל הנתונים נוצרו על ידי מודל יחיד, Claude 3.7 Sonnet, במסגרת הרצה של סוכן ספציפי אחד. אם המודל הזה סובל מעיוורון מסוים או מדפוסי קוד שגויים, הם מוטמעים ישירות במסלולים. בנוסף, כל הטקסט והקוד הם באנגלית בלבד, ואין כאן משימות בעברית או תמיכה מובנית בתיעוד מקומי. הנתונים פורסמו באפריל 2025, כך שהם מוגבלים לספריות וגרסאות שהיו זמינות באותו זמן.

שאלות
נפוצות

האם מותר להשתמש בזה כדי לאמן מודל מסחרי?

כן, הרישיון המדווח הוא MIT ולכן אין מגבלה על שימוש מסחרי, שילוב במוצרים סגורים או הפצה של מודלים שאומנו על הנתונים. צריך רק לוודא שאתם משאירים את הצהרת זכויות היוצרים המקורית לפי תנאי הרישיון.

האם יש במאגר דוגמאות או קוד בעברית?

לא. המאגר מוגדר כמאגר באנגלית בלבד, וכל המשימות מבוססות על פרויקטי תוכנה בקוד פתוח שמתנהלים באנגלית. אם אתם מחפשים תמיכה בהערות בעברית או בממשקים מקומיים, תצטרכו להוסיף נתונים כאלה בעצמכם.

איך הנתונים האלה נוצרו בפועל?

החוקרים לקחו משימות מתוך המאגר SWE-smith, והריצו עליהן את כלי הסוכן SWE-agent כשהוא מופעל באמצעות המודל Claude 3.7 Sonnet. התוצאה היא 5,017 מסלולי פתרון מתועדים שכוללים את כל הפעולות שהמודל ביצע מול הסביבה.

מה ההבדל בין המאגר הזה לבין SWE-smith הרגיל?

המאגר הרגיל כולל את המשימות עצמן והגדרות הבדיקה, בעוד שהמאגר הנוכחי מכיל את מסלולי הפתרון המלאים שנרשמו בזמן הריצה של קלוד. מדובר בתיעוד הפעולות שלב אחרי שלב, שנועד ישירות לאימון מודלים של סוכנים.

איך טוענים

אתם מושכים את הקבצים ישירות דרך ספריית datasets באמצעות המזהה הרשמי, ללא צורך בהרשאת גישה מיוחדת או אישור מראש. הנתונים מגיעים בפורמט פרקט ומפוצלים לשמונה קובצי חלקים לצד קובצי הגדרה נוספים, כך שטעינה ישירה לזיכרון תדרוש קריאה של המקטעים לפי הצורך. כדאי לשים לב למבנה של מסלול הריצה כדי לחלץ נכון את פקודות הסוכן והתגובות של הסביבה לפני שמתחילים להזין אותם לתהליך אימון.

from datasets import load_dataset

ds = load_dataset("SWE-bench/SWE-smith-trajectories")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הנתונים, להפיץ אותם מחדש ולאמן עליהם מודלים ללא דרישה לשתף את התוצרים באותו רישיון. החובה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗