GPT
S

SWE-bench/SWE-bench_Lite

קוד פתוח

SWE-benchרישיון לא דווח2025-04-29

זהו אוסף מצומצם של בעיות גיטהאב אמיתיות לבדיקת מודלים על פתרון תקלות קוד מקצה לקצה. הוא נועד למי שרוצה בנצ'מרק מהיר וממוקד בלי להריץ את הסט המלא.

  • 34,200הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל זוגות של תיאורי תקלות ובקשות משיכה שנאספו מתוך 11 ספריות פייתון פופולריות בגיטהאב. הוא מהווה תת קבוצה של המאגר המקורי והרחב יותר, ומכיל 300 צמדי בדיקה שנבחרו כדי להעריך יכולת פתרון בעיות תוכנה אמיתיות בעזרת בדיקות יחידה שנלקחו מהפתרון המקורי.

המבנה הפנימי מחולק לקובצי פרקט שמכילים את המידע עבור שלבי הפיתוח והבדיקה, לצד קובץ הגדרות להרצה. כל רשומה כוללת את תיאור התקלה מתוך האישו ואת מזהה הקומיט שמייצג את מצב בסיס הקוד לפני כניסת התיקון, כך שהמודל נדרש להבין את הבעיה ולייצר שינוי שעובר את הבדיקות.

מתאים ל

  • הערכת סוכני קוד בפייתון

    מדידת היכולת של מודלים לפתור תקלות אמיתיות על בסיס קוד קיים ובדיקות יחידה.

  • בדיקת אלגוריתמי אחזור לקוד

    בחינת מנועי חיפוש פנימיים שמאתרים קבצים רלוונטיים לפי תיאור תקלה בלבד.

  • השוואת ביצועים מול הלידרבורד

    הרצת בדיקות השוואתיות לפי הסטנדרט המקובל באתר הרשמי של הפרויקט.

איפה זה נופל

הנתונים מתמקדים אך ורק בתוכנה שנכתבה בפייתון ומבוססים על 11 ספריות בלבד, כך שהם לא מייצגים שפות פיתוח אחרות או מבני פרויקטים שונים. הטקסטים נשענים על גיטהאב ונכתבו בעיקר באנגלית, כשהיוצרים מציינים במפורש שלא בוצע סינון שפתי על הנתונים. מעבר לכך, המאגר מספק רק את תיאור התקלה והקומיט ההתחלתי, מה שדורש מכם להקים את סביבת ההרצה המלאה ובדיקות היחידה כדי למדוד הצלחה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

בעמוד הדאטהסט לא מופיע מידע על רישיון. במצב כזה אין אישור מפורש לעשות שימוש מסחרי בנתונים או במודלים שאומנו עליהם. אם אתם מתכננים מוצר, עדיף לפנות ליוצרים לבירור לפני שמתחילים לעבוד איתו.

האם יש במאגר תמיכה בעברית?

הטקסטים מגיעים מגיטהאב ונכתבו בעיקר באנגלית. היוצרים ציינו שלא ביצעו שום ניקוי או סינון לפי שפה, כך שאין כאן התאמה או נוכחות של עברית.

מה ההבדל בין הגרסה הזו לגרסה המלאה של המאגר?

גרסת הלייט מכילה רק 300 צמדים של תקלות ובקשות משיכה מתוך 11 ספריות פייתון. היא נבנתה כתת קבוצה קטנה יותר שמאפשרת לבצע הערכות והרצות בדיקה מהירות וזולות יותר בהשוואה למאגר המקורי.

מה מקבלים בפועל בכל דגימה?

כל רשומה כוללת בעיקר את תיאור התקלה מגיטהאב ואת מזהה הקומיט שממנו מתחילים. היא לא כוללת הקשר מורחב שנשלף מראש או את קובצי המקור עצמם, אותם צריך לשחזר מול המאגרים הרלוונטיים.

איך טוענים

הנתונים מגיעים בקובצי פרקט פתוחים להורדה ישירה מתוך המאגר, בלי צורך בבקשת גישה מיוחדת. כדי להריץ בדיקות בפועל תצטרכו לעבוד עם שני שדות מרכזיים: תיאור התקלה ומזהה קומיט הבסיס. המאגר עצמו מספק רק את נקודת ההתחלה של הקוד ולא כולל שליפה מובנית של הקשר, כך שאם אתם מתכננים להשתמש בשיטות כמו אחזור מבוסס מילים או הגדרות מונחות, תצטרכו להביא אותן בעצמכם או לבדוק את גרסאות ההרחבה שהחוקרים פרסמו בנפרד.

from datasets import load_dataset

ds = load_dataset("SWE-bench/SWE-bench_Lite")

הרישיון

המפרסמים לא דיווחו על רישיון שימוש בעמוד המאגר. כשאין רישיון מוגדר, מבחינה משפטית אין הרשאה ברורה להשתמש בנתונים לאימון מודלים, למחקר מסחרי או להפצה מחדש. אם אתם בונים מוצר מסחרי, לא כדאי לגעת בזה לפני שיוצרי המאגר יבהירו את תנאי השימוש הרשמיים.

הרישיון המלא ב־Hugging Face ↗