GPT
S

SWE-bench-extra

קוד פתוח

nebiuscc-by-4.02024-12-08

  • code
  • synthetic
  • tools
  • agents
  • software

המאגר מרחיב את SWE-bench עם 6,415 צמדים של תקלות ובקשות משיכה מ־1,988 מאגרי פייתון. הוא מיועד למי שרוצה לאמן או לבחון סוכני קוד על בסיס נתונים שעברו בדיקת הרצה בפועל.

  • 23,552הורדות בחודש
  • 47לייקים

מה זה

הנתונים נאספו ממאגרי קוד פתוח בפייתון בגיטהאב לפי המתודולוגיה של SWE-bench. הרשומות מורכבות מתיאור התקלה, טלאי התיקון שפתר אותה, טלאי בדיקות שנכתב במיוחד, והפניות לקומיטים הרלוונטיים. התהליך כלל הצלבה של תקלות מול בקשות משיכה, סינון לפי איכות התיאור ורלוונטיות הקוד, ואימות בהרצה של סביבת הפרויקט והבדיקות כדי לוודא שהפתרון באמת עובד.

המבנה כולל קובץ אימון יחיד שמכיל את כל המקרים. כל שורה מייצגת משימה מלאה שכוללת את מזהה המאגר, תיאורי הבעיה, רשימות של בדיקות שנכשלו לפני התיקון ועברו אחריו, ועמודת מטא שמפרטת האם המקרה עומד בקריטריונים המקלים או באילו בדיקות איכות הוא נכשל.

מתאים ל

  • אימון סוכני קוד אוטונומיים

    לימוד מודלים לפתור תקלות תוכנה מורכבות על בסיס קוד קיים, תיאור הבעיה וטלאי הפתרון.

  • הערכת ביצועי מודלים

    בחינה של סוכנים ומודלי שפה על תקלות אמיתיות עם בדיקות הרצה מוגדרות מראש.

  • יצירת מסלולי פעולה

    בניית דאטהסטים של מסלולי פתרון בעיות ואימון מודלים מנחים לחיפוש תיקונים נכונים.

איפה זה נופל

הנתונים מוגבלים לחלוטין לקוד פייתון ולתקלות שנכתבו באנגלית, כך שאין כאן שום ייצוג לשפות תכנות אחרות או לטקסט בעברית. בנוסף, המפתחים עצמם מציינים שיש למאגר הזה יורש חדש וגדול יותר בשם SWE-rebench. אם אתם מתכננים הערכה מודרנית או אימון רחב, כדאי לבדוק קודם אם המאגר המעודכן מתאים יותר לפני שמשקיעים משאבים בגרסה הזו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר עצמו הוא cc-by-4.0 שמאפשר שימוש מסחרי תחת מתן קרדיט. יחד עם זאת, הקוד שבפנים מגיע מ־1,988 מאגרים שונים עם רישיונות נפרדים שמתועדים בשדה הייעודי. יש לבדוק את הרישיון של כל מאגר לפני שמשלבים נתונים במוצר מסחרי.

האם יש במאגר תמיכה בעברית?

לא. כל תיאורי התקלות, ההערות והקוד מקורם בפרויקטים בינלאומיים בגיטהאב והם כתובים באנגלית בלבד.

מה ההבדל בין המאגר הזה ל־SWE-bench המקורי?

המאגר מוסיף 6,415 צמדים חדשים של תקלות ותיקונים שנאספו באותה שיטה ומאותם סוגי מקורות. בנוסף, הוא כולל שדה מטא שמפרט האם הדוגמה עומדת בתנאי הסינון המחמירים ובאילו בדיקות איכות היא נכשלה.

האם כדאי להשתמש בו לפרויקט חדש?

תלוי בצורך. יוצרי המאגר מציינים שקיים מאגר המשך בשם SWE-rebench, שהוא גדול ומשופר יותר. מומלץ לבחון את המאגר החדש לפני שמתחילים תהליך עבודה ארוך על הגרסה הזו.

איך טוענים

טוענים את המאגר ישירות בעזרת load_dataset מספריית datasets תחת השם nebius/SWE-bench-extra. הנתונים שמורים בקובץ פרקט יחיד, ואין צורך לבקש אישור גישה מראש כדי להוריד אותו.

לצורך הרצה מעשית של הקוד והבדיקות, המאגר מספק קובץ constants.py עם הגדרות נחוצות להתקנת התלויות בסביבה. השדות החשובים לביצוע המשימות הם instance_id, problem_statement, הטלאים patch ו־test_patch, ורשימות הבדיקות FAIL_TO_PASS כדי לדעת מה לאמת.

from datasets import load_dataset

ds = load_dataset("nebius/SWE-bench-extra")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, עריכה והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, כל מקרה נלקח ממאגר קוד פתוח אחר עם תנאים משלו. כדי לדעת אם מותר להשתמש במודל שאומן על דוגמה מסוימת, חובה לבדוק את שדה הרישיון הפרטני של אותו מאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗