GPT
S

SWE-bench/SWE-bench_Verified

קוד פתוח

SWE-benchרישיון לא דווח2025-04-29

חמש מאות תקלות אמיתיות מגיטהאב שעברו אימות אנושי כדי לבחון תיקון קוד אוטונומי. מי שמחפש בנצ׳מרק אמין שלא מבזבז זמן על בעיות שבורות או הגדרות עמומות ירצה להתחיל כאן.

  • 125,709הורדות בחודש
  • 153לייקים

מה זה

מדובר בתת-קבוצה מתוך סט הבדיקה של SWE-bench המקורי, שכוללת 500 זוגות של תיאורי בעיות ובקשות מיזוג ממאגרי פייתון פופולריים. המטרה כאן היא לבדוק פתרון תקלות מקצה לקצה, כשהמערכת מקבלת דיווח תקלה ומצב מאגר נתון, וצריכה לספק קוד שמתקן אותו. בדיקת ההצלחה נשענת על הרצת בדיקות יחידה מתוך הקוד שנבדק, כאשר ההתנהגות לאחר המיזוג משמשת כפתרון הייחוס.

בניגוד לגרסאות המלאות שמכילות רעש מבני, הדגימות כאן נבררו ואומתו ידנית בידי בני אדם כדי לוודא שהבעיות מוגדרות כהלכה וניתנות לפתרון בעזרת המידע הקיים. כל רשומה כוללת בעיקר את תיאור התקלה ואת מצב הריפו לפני התיקון, ללא תוספות של אחזור טקסט מקדים שמגיעות בגרסאות אחרות של המאגר.

מתאים ל

  • הערכת סוכני קוד

    בדיקת יכולת של מודלים לפתור תקלות פייתון אמיתיות מקצה לקצה על בסיס נתונים מאומתים.

  • השוואת ביצועים ללוח תוצאות

    מדידת תוצאות כלי הפיתוח מול הדירוג הרשמי שמפורסם באתר הפרויקט.

  • ניתוח כשלי הרצה

    בחינת המקומות שבהם מודלי שפה נכשלים בהבנת דוחות שגיאה ומבנה מאגרי קוד מורכבים.

איפה זה נופל

הטקסט ברובו באנגלית ומבוסס רק על פרויקטים בשפת פייתון, כך שהוא לא מלמד כלום על התמודדות עם עברית או עם שפות פיתוח אחרות. היוצרים מציינים שלא נעשה סינון או ניקוי מפורש על בסיס שפה. בנוסף, חמש מאות מקרים זה מדגם קטן יחסית שמתאים לבדיקה והערכה של מודלים, אבל לא מספיק כדי לאמן עליו מודל מאפס. מי שמחפש משימות עם הקשרים מוכנים מראש ימצא פה רק נקודת פתיחה גולמית של הבעיה והקוד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לצרכים מסחריים?

לא דווח רישיון עבור המאגר הזה, ולכן אין היתר כתוב להשתמש בו למוצרים מסחריים. מאחר שהנתונים מבוססים על קוד ממאגרים שונים ברשת, כל שימוש שאינו בדיקה מחקרית ידרוש בדיקה עצמאית של תנאי הפרויקטים המקוריים.

במה הגרסה הזו שונה מ־SWE-bench הרגיל?

הגרסה המאומתת הזו כוללת 500 דוגמאות מתוך סט הבדיקה שעברו סינון ידני של בני אדם כדי להבטיח איכות תיאור ובדיקות תקינות. היא חוסכת נפילות שנובעות מבעיות שבורות או בדיקות יחידה לא מדויקות שקיימות לעיתים במאגר הגדול.

האם יש במאגר נתונים בעברית?

לא, הנתונים מגיעים ממאגרי פייתון ציבוריים והטקסט בהם הוא בעיקר באנגלית. היוצרים מעידים שלא ביצעו שום סינון או ניקוי שפתי, כך שאין כאן ייצוג לעברית.

האם המאגר כולל את נתוני הקוד המלאים לשליפה?

הקובץ מספק רק את תיאור התקלה ואת מזהה הקומיט של בסיס הקוד לפני הפתרון. אם רוצים להשתמש במנגנוני שליפה כמו בי-אם עשרים וחמש, צריך לממש אותם לבד או להשתמש בגרסאות הליט המותאמות שצוינו בתיעוד.

איך טוענים

הקובץ המרכזי יושב בפורמט פארקט יחיד תחת תיקיית המידע, לצד קובץ הגדרות להרצה, כך שטעינה ישירה לסביבת עבודה בפייתון לוקחת שניות בודדות ולא דורשת אישור גישה מיוחד. המאגר מכיל רק ארבעה קבצים בסך הכל. לפני שמריצים, שימו לב שהנתונים מביאים רק את תיאור הבעיה ואת מזהה הקומיט של בסיס הקוד, בלי הקשרים מובנים של מנועי אחזור. אם אתם בונים על שיטות שליפה כמו אוקל או בי-אם עשרים וחמש, תצטרכו להביא אותם בעצמכם או לפנות לגרסאות הייעודיות שמפרסמי המאגר הזכירו.

from datasets import load_dataset

ds = load_dataset("SWE-bench/SWE-bench_Verified")

הרישיון

המאגר פורסם בלי פירוט של רישיון רשמי. מבחינה משפטית זה אומר שאין אישור מפורש לשימוש מסחרי, לאימון מודלים או להפצה חוזרת של החומרים. בנוסף, הקוד והבעיות נמשכו ממאגרי גיטהאב שונים שלכל אחד מהם עשוי להיות רישיון קוד פתוח משלו, כך שחובה לבדוק את המקורות לפני שבונים על זה משהו מעבר למחקר פנימי.

הרישיון המלא ב־Hugging Face ↗