GPT
S

SWE-rebench

קוד פתוח

nebiuscc-by-4.02025-04-28

מאגר של מעל 21,000 משימות הנדסת תוכנה אמיתיות מפייתון שנבדקו בהרצה חיה. הוא מיועד למי שרוצה לאמן או לבחון סוכני קוד על דוגמאות עדכניות בלי להסתבך עם סביבות שבורות.

  • 150,260הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל צמדים של תיאור תקלה ובקשת מיזוג מגיטהאב, שנאספו באופן אוטומטי מלמעלה מ־3,400 מאגרי פייתון שונים. כל רשומה כוללת את תיאור הבעיה המקורי, הטלאי שפותר אותה, טלאי הבדיקות, רשימות מדויקות של טסטים שצריכים לעבור או להיכשל, והגדרות סביבה מלאות לצורך הרצה ובדיקה.

האיסוף מתבסס על צינור אוטומטי שמשתמש במודלי שפה כדי לחלץ הוראות התקנה ולהעריך את איכות המשימות, למשל רמת המורכבות והבהירות שלהן. הקבצים מחולקים למבנה של בדיקה וסינון בפורמט פרקט, ומלווים ב־7,500 תמונות דוקר מוכנות מראש שנשמרו בדוקר האב כדי לחסוך את זמן הבנייה של הסביבות.

מתאים ל

  • אימון סוכני קוד בחיזוק

    אימון ושיפור מודלים לפתרון תקלות תוכנה אמיתיות באמצעות תמונות הדוקר המוכנות להרצה מהירה.

  • בנצ'מרק להערכת מודלים

    מדידת ביצועים של סוכני פיתוח על משימות פייתון מאומתות עם בדיקות תוכנה מוגדרות מראש.

  • מחקר על תהליכי פיתוח

    ניתוח האופן שבו בעיות תוכנה נפתרות בפועל על פני אלפי פרויקטים שונים בקוד פתוח.

איפה זה נופל

כל המשימות מגיעות ממאגרי פייתון בלבד, כך שמי שמחפש לכסות שפות תכנות אחרות יצטרך לפנות למקורות נוספים. בנוסף, שלב החילוץ והערכת איכות המשימות נשען בעצמו על מודלי שפה, מה שעלול להכניס הטיות מערכתיות של המודלים לתהליך הסינון. חשוב לבדוק את שדה הרישיון הפרטני של כל ריפו לפני שמשלבים נתונים באימון מסחרי, כי הנתונים נלקחו ממאגרי קוד פתוח עם תנאים שונים זה מזה.

אותה משפחה

SWE-rebench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

המאגר עצמו מפורסם ברישיון חופשי שמאפשר שימוש מסחרי, אך דגימות הקוד שבו הגיעו מאלפי פרויקטים שונים. כל רשומה כוללת את רישיון המקור של אותו פרויקט, וצריך לוודא שהוא מתאים לדרישות המשפטיות שלכם לפני אימון מודל.

האם יש במאגר משימות בעברית או תמיכה בשפות אחרות?

לא. הנתונים מבוססים על פרויקטי פייתון מגיטהאב והתיעוד כתוב באנגלית. אין במאגר טקסטים או משימות בעברית, והקוד מוגבל לפייתון בלבד.

מה ההבדל בינו לבין המאגר המקורי של המבחן?

הוא מרחיב את המאגר המקורי ליותר מ־21,000 משימות תוך שימוש בצינור אוטומטי מתמשך לחילוץ ובדיקה. בנוסף, הוא כולל מטא-דאטה עשיר יותר על איכות המשימות, הגדרות התקנה מדויקות ותמונות דוקר מוכנות להרצה.

האם חייבים לבנות את סביבות הדוקר לבד?

לא עבור רוב המשימות המרכזיות. היוצרים שחררו 7,500 תמונות דוקר מוכנות מראש לשימוש חופשי, כך שאפשר להריץ עליהן בדיקות וסוכנים מיד בלי להמתין להתקנות מקומיות.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של האגינג פייס בפקודת טעינה פשוטה של שם המאגר. הנתונים שמורים בקובצי פרקט פתוחים ללא צורך בהרשאת גישה מיוחדת. כדי להריץ את המשימות עצמן ולהפעיל עליהן סוכנים, משתמשים במזלג של שלד ההרצה שפרסמו היוצרים, אשר קורא את שדות התקנת הסביבה והתלויות מתוך כל רשומה או מושך ישירות את תמונות הדוקר המוכנות.

from datasets import load_dataset

ds = load_dataset("nebius/SWE-rebench")

הרישיון

המאגר מופץ ברישיון ייחוס 4.0 חופשי שמתיר שימוש מסחרי, עריכה ושינוי, כל עוד נותנים קרדיט ליוצרים. עם זאת, קטעי הקוד והטלאים עצמם נאספו ממאגרי גיטהאב חיצוניים, וכל רשומה מציינת את הרישיון המקורי שלה. מי שמאמן מודל לצורך מסחרי מחויב לוודא שתנאי הרישיון של המאגרים המקוריים מאפשרים זאת.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗