GPT
S

SWE-bench_Pro

קוד פתוח

ScaleAIרישיון לא דווח2025-08-26

מאגר לבדיקת סוכני תוכנה מול משימות פיתוח מורכבות ברמת ארגון. מי שבונה מודלים לקוד ירצה אותו כדי לבחון יכולת לפתור בעיות אמיתיות שדורשות רצף פעולות ארוך.

  • 60,020הורדות בחודש
  • 179לייקים

מה זה

המאגר מבוסס על המבנה של SWE-bench Verified עם תוספות של שדות ייעודיים. הרשומות מייצגות בעיות קוד מעשיות שנלקחו מתוך 11 מחלקות של מאגרי קוד, ומכסות 4 שפות תכנות שונות. כל רשומה כוללת מזהה ייחודי, תיאור הבעיה, קוד המקור בגרסת הבסיס, והטלאי שמתקן אותה בפועל.

בנוסף לתיאור הבסיסי, המאגר מספק מעטפת שלמה להרצה: בדיקות שצריכות לעבור רק אחרי התיקון, בדיקות שחייבות להמשיך לעבור, דרישות מערכת, ממשקים, פקודות הכנה ומפרט של קובצי הבדיקה שיש להריץ. הנתונים מחולקים גם לפי רמת הספציפיות וסוגי הקטגוריות של התקלה.

מתאים ל

  • הערכת סוכני קוד

    בדיקת ביצועים של מודלים מול בעיות תכנות ארוכות ומורכבות בעזרת טלאי בדיקה אמיתיים.

  • בנצ'מרק השוואתי

    מדידת יכולת התיקון האוטונומי של מודלים שונים על פני ארבע שפות תכנות מוגדרות.

  • אימון על תהליכי דיבאגינג

    לימוד מודלים להבין תיאורי תקלות ולייצר טלאי קוד שעומדים במבחני בדיקה קיימים.

איפה זה נופל

המאגר כולל 11 מחלקות של ריפוזיטוריז וארבע שפות תכנות בלבד, מה שמגביל את המגוון הרחב של סביבות פיתוח קיימות. שדות כמו דרישות וממשקים יכולים להכיל ערכי null, כך שהמודל שלכם לא תמיד יקבל את כל ההקשר הדרוש. הטקסטים של הבעיות והתיעוד הם באנגלית בלבד, ואין פירוט לגבי תאריכי הגזירה של הקוד.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

לא פורסם רישיון רשמי בדף המאגר של ScaleAI. היעדר רישיון אומר שאין לכם אישור מפורש להשתמש בנתונים לצורך אימון מסחרי או פיתוח מוצרים. אם אתם שוקלים להכניס אותו לסביבה עסקית, חובה לקבל הבהרה משפטית או לחכות שיוסיפו רישיון מוכר.

האם יש במאגר נתונים בעברית?

אין במאגר עברית כלל. כל תיאורי הבעיות, הממשקים והתלויות נכתבו באנגלית, כפי שמקובל במאגרי קוד בינלאומיים. אם המטרה שלכם היא מודל שמבין הנחיות פיתוח בעברית, תצטרכו לתרגם את הנתונים בעצמכם או להסתמך על מקורות אחרים.

מאיפה נאסף הקוד ומה ההבדל מדאטהסטים דומים?

המאגר מבוסס על 11 מחלקות של מאגרי קוד בארבע שפות, וממשיך את המבנה של SWE-bench Verified. ההבדל העיקרי הוא תוספת שדות ברמת enterprise שנועדו למשימות ארוכות טווח, כמו פקודות הכנה לסביבה וממשקים מפורטים. החומר מלווה במאמר ובקוד הערכה ייעודי שמספקת החברה בגיטהאב.

איך טוענים

הנתונים מגיעים בקובץ Parquet יחיד תחת תיקיית data, לצד קובץ הגדרות eval.yaml ומסמך README. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. בעבודה השוטפת, השדות המרכזיים להרצה הם תיאור הבעיה, פקודת ההכנה של המאגר, הטלאי שמייצג את פתרון הזהב, והבדיקות שמגדירות הצלחה.

from datasets import load_dataset

ds = load_dataset("ScaleAI/SWE-bench_Pro")

הרישיון

היוצרים לא ציינו רישיון בדף המאגר. כל עוד אין רישיון ברור, מבחינה משפטית השימוש בנתונים מסוכן ואין היתר מפורש לאמן עליהם מודל או להשתמש בהם במוצר מסחרי. מומלץ לבדוק את הרישיונות של מאגרי הקוד המקוריים עצמם או להמתין להסדרה.

הרישיון המלא ב־Hugging Face ↗