GPT
S

SWE-bench/SWE-bench

קוד פתוח

SWE-benchרישיון לא דווח2025-04-29

המאגר מרכז 2,294 בעיות אמיתיות מגיטהאב יחד עם הפתרונות שלהן. הוא נבנה כדי לבדוק אם מודל שפה מסוגל לקחת תיאור תקלה ולתקן קוד בפרויקט שלם.

  • 16,694הורדות בחודש
  • 36לייקים

מה זה

הנתונים כוללים 2,294 זוגות של תיאורי תקלות ובקשות מיזוג שנאספו מתוך 12 מאגרי קוד פתוח פופולריים בשפת פייתון. כל רשומה מציגה אתגר מעשי מהחיים האמיתיים של פיתוח תוכנה, ולא תרגיל סינתטי שנכתב עבור מודלים.

במקום קטעי קוד מבודדים, כל דוגמה מקושרת למצב המאגר לפני התיקון באמצעות מזהה גרסה ספציפי, יחד עם התיאור המקורי של התקלה כפי שנכתב על ידי משתמשים. הבדיקה מול הנתונים מתבצעת על ידי הרצת בדיקות יחידה מתוך הפרויקט, כאשר ההתנהגות לאחר מיזוג הפתרון משמשת כנקודת ייחוס להצלחה.

המאגר מחולק לקבצי פארקט לפי ספליטים של פיתוח ובדיקה. החלוקה הזו מאפשרת להריץ הערכות ביצועים ישירות על הנתונים, בתנאי שמושכים את הקוד המלא מהמאגרים המקוריים לפי נתוני הגרסה שמצורפים לכל רשומה.

מתאים ל

  • בחינת מודלים על תיקון באגים

    מדידת היכולת של מודל לפתור תקלות פייתון אמיתיות מול בדיקות יחידה קיימות.

  • פיתוח סוכני תוכנה אוטונומיים

    בדיקת מערכות שמנווטות במאגר קוד שלם על בסיס תיאור תקלה וגרסת בסיס.

  • השוואה ללוח התוצאות הרשמי

    הרצת בדיקות סטנדרטיות כדי למקם ביצועי מודל חדש מול מערכות מובילות בתחום.

איפה זה נופל

המאגר מוגבל לשפת פייתון בלבד ומתבסס על 12 ספריות בלבד, כך שהוא לא מייצג שפות אחרות או סגנונות פיתוח שונים. הטקסט ברובו באנגלית, והיוצרים מציינים במפורש שלא נעשה שום מאמץ לסנן או לנקות את הנתונים לפי שפה. בנוסף, המאגר הגולמי לא מכיל את כל קבצי הקוד אלא רק מצביעי גרסאות ותיאורים, מה שמחייב תשתית חיצונית שלמה כדי לשחזר את סביבת הבדיקות ולהריץ אותן בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ כרגע. לא דווח רישיון עבור המאגר הזה, וללא הגדרה ברורה של זכויות השימוש, הכנסת הנתונים למוצר מסחרי עלולה לחשוף אתכם לתביעות על הפרת זכויות יוצרים.

האם יש במאגר תמיכה בשפות נוספות חוץ מפייתון?

לא. כל 2,294 הדוגמאות נאספו מתוך 12 ספריות קוד פתוח שנכתבו בפייתון בלבד, כך שהוא לא מתאים לבדיקת יכולות בשפות כמו ג׳אווה, גו או טייפסקריפט.

האם המאגר כולל טקסט בעברית?

הטקסט של תיאורי התקלות מורכב בעיקר מאנגלית. היוצרים מעידים שהם לא ביצעו סינון או ניקוי שפתי, אך מכיוון שמדובר במאגרים בינלאומיים פופולריים, עברית כמעט ולא קיימת שם.

האם אפשר להתחיל להריץ מודלים ישירות מהקבצים האלה?

לא מיד. הקבצים מכילים רק את תיאור הבעיה ואת מזהה הגרסה בגיט, ולכן צריך למשוך את שאר הקוד בעצמכם או להוריד גרסאות עיבוד אחרות של הפרויקט שמכילות את ההקשר המלא.

איך טוענים

הנתונים יושבים בקבצי פארקט ומחולקים לחלקי פיתוח ובדיקה. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותם. עם זאת, הרשומות עצמן מכילות רק את תיאור התקלה ואת מזהה הגרסה של הקוד לפני התיקון. מי שרוצה להריץ בדיקות בפועל יצטרך לשלוף את הקוד המלא מהגיטהאב לפי אותם מזהים, או להשתמש בגרסאות מאגר שמכילות אחזור מובנה כמו אלו המבוססות על מודל חיפוש ייעודי.

from datasets import load_dataset

ds = load_dataset("SWE-bench/SWE-bench")

הרישיון

היוצרים לא דיווחו על רישיון בעמוד המאגר. המשמעות ברורה ומחייבת זהירות: ברירת המחדל בחוק היא שללא רישיון מפורש אין היתר להשתמש, להפיץ או לאמן מודלים על החומר הזה, במיוחד לא בסביבה מסחרית. כל שימוש מעבר למחקר פנימי או בדיקה נקודתית דורש בדיקה מול היוצרים כדי להימנע מסיכונים משפטיים.

הרישיון המלא ב־Hugging Face ↗