GPT
S

SWE-smith

קוד פתוח

SWE-benchmit2025-04-29

  • code
  • agents
  • software-engineering

מאגר לאימון סוכני תוכנה שמכיל מעל חמישים אלף משימות אמיתיות מגיטהאב עם סביבות ריצה. מתאים למי שרוצה לאמן מודלים על פתרון בעיות קוד מקצה לקצה.

  • 151,957הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל 50,137 משימות שחולצו מתוך 128 מאגרי קוד שונים בגיטהאב באמצעות כלי ייעודי בשם SWE-smith. כל רשומה מייצגת משימת הנדסת תוכנה ממשית, והיא מגיעה יחד עם סביבת ריצה עצמאית שמאפשרת לבדוק ולהריץ את הקוד בפועל ולא רק לייצר טקסט עיוור.

הנתונים מיועדים למשימות יצירת טקסט ואימון מודלי שפה לעולם התוכנה, והם מאורגנים בפיצול יחיד לאימון שמחולק לקבצי פארקט. המפתחים אספו את הנתונים כדי לספק בסיס נתב רחב יותר ללמידה מונחית של סוכני פיתוח, במקום להסתמך רק על דוגמאות בודדות או על מאגרי הערכה קטנים.

מתאים ל

  • אימון סוכני קוד

    לימוד מודלי שפה לפתור תקלות פיתוח אמיתיות מתוך מאגרי גיטהאב עם יכולת אימות בסביבה.

  • למידה מונחית לתכנות

    שימוש ברבבות המשימות כבסיס לביצוע פיין-טיונינג שמטרתו לשפר דיוק בכתיבת טלאי קוד.

  • מחקרי הערכה בסביבת ריצה

    בדיקת ביצועים של מודלים מול משימות שכוללות סביבת הרצה שלמה לבדיקת תוצאות.

איפה זה נופל

היוצרים הודיעו רשמית שהם הפסיקו לתחזק ולעדכן את המאגר הזה, וממליצים לעבור לגרסאות מפוצלות לפי שפות תכנות. בנוסף, כל התיעוד והטקסטים במאגר הם באנגלית בלבד ואין בו שום תמיכה בעברית. לפני שמכניסים אותו לתהליך אימון יקר, כדאי לזכור שהוא מוגבל ל־128 ריפוזיטוריז בלבד, מה שעלול לייצר הטיה לסגנון כתיבה ולדפוסי בדיקות של פרויקטים ספציפיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מוצר מסחרי?

כן, הרישיון הוא MIT ולכן השימוש המסחרי מותר לחלוטין. תוכלו לאמן עליו מודלים פנימיים או לשלב אותו במערכות סגורות בלי לפתוח את הקוד שלכם.

האם יש במאגר נתונים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל המשימות, הקוד, התיעוד והשיחות נלקחו ממאגרי גיטהאב בינלאומיים שמתנהלים באנגלית.

למה היוצרים ממליצים להשתמש במאגרים אחרים?

הצוות הפסיק לעדכן את המאגר הכולל הזה כדי לפשט את התחזוקה. הם עברו לחלק את הנתונים לפי שפות תכנות ספציפיות בדאטהסטים נפרדים, ולכן ממליצים לעבוד איתם.

איך המשימות מאורגנות ומה הן כוללות?

המאגר מכיל מעל חמישים אלף משימות מ־128 פרויקטים שונים. כל משימה מגיעה עם סביבת ריצה מוכנה שמאפשרת לבחון את התיקון בפועל.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית הדאטהסטס מיוזר SWE-bench, בלי צורך בבקשת גישה מיוחדת כי המאגר ציבורי. הנתונים מחולקים ל־11 קבצי פארקט שונים, לכן כדאי לתכנן מראש את צריכת הזיכרון בעת הטעינה ולמשוך רק את החלקים הרלוונטיים בריצה מקומית. כדי לנצל את הערך המלא של הרשומות, תצטרכו להשתמש בסביבות הריצה המצורפות לכל משימה לפי ההנחיות באתר הפרויקט.

from datasets import load_dataset

ds = load_dataset("SWE-bench/SWE-smith")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שנותן חופש כמעט מוחלט לעשות בו שימוש מסחרי, לשנות אותו ולשלב אותו במוצרים סגורים. אין כאן חובת שיתוף זהה, כך שמודל שאומן על הנתונים אינו מחויב להיפתח לציבור, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗