GPT
S

SWE-rebench-V2

קוד פתוח

nebiuscc-by-4.02026-02-04

  • code
  • software-engineering
  • swe-bench
  • nebius

מאגר משימות פיתוח מרובה שפות שמבוסס על בעיות אמיתיות מגיטהאב וכולל טסטים מוכנים. הוא מיועד למי שרוצה לבחון או לאמן סוכני קוד מעבר לפייתון בלבד.

  • 102,573הורדות בחודש
  • 59לייקים

מה זה

המאגר מכיל 32,079 דוגמאות של תקלות אמיתיות ובקשות מיזוג שנלקחו ממאגרי גיטהאב ציבוריים. הרשומות כוללות תיאור של הבעיה המקורית, תיאור הפיאר, הקומיט שעליו מתבססים, והתיקון בפועל שנחשב לפתרון הנכון. לצד אלה יש את קוד הבדיקות שמוודא את התיקון, רשימות של טסטים שנכשלים לפני התיקון ועוברים אחריו, והגדרות סביבה מדויקות להרצה.

בניגוד למאגרים דומים שמתמקדים כמעט רק בפייתון, כאן נאסף קוד מעשרים שפות תכנות שונות, ביניהן גו, טייפסקריפט, ראסט, ג'אווה, סי פלוס פלוס, פיאייצ'פי וסוויפט. כל הנתונים מרוכזים בפיצול יחיד של אימון, וכל שורה מגיעה עם שם קובץ הדוקר שלה והגדרות ההתקנה לצורך שחזור הסביבה שבה הקוד נבדק. הנתונים מכילים גם הערכות איכות שהופקו באמצעות מודלי שפה לצד הרישיון המקורי של הפרויקט שממנו נלקח הקוד.

מתאים ל

  • אימון סוכני תכנה

    אימון מודלים לפתרון באגים מורכבים על בסיס בעיות אמיתיות מקוד פתוח.

  • בנצ'מרק להערכת מודלים

    בדיקת יכולת המודל לייצר טלאי קוד שעובר טסטים ספציפיים בעשרים שפות שונות.

  • מחקר על תיקון תקלות

    ניתוח דפוסי שינויי קוד ואינטראקציה בין בדיקות יחידה לפתרון בעיות.

איפה זה נופל

הטקסט והתיאורים מגיעים כולם באנגלית, בלי שום תוכן בעברית או תמיכה מקומית. איכות הנתונים וההערות נשענת בחלקה על סינון בעזרת מודלי שפה, מה שעלול להכניס רעש או הטיות בבחירת הדוגמאות. מעבר לזה, המאגר מציג רק פיצול אחד של אימון ואין חלוקה מובנית לסט מבחן או אימות, כך שאתם צריכים לפצל אותו בעצמכם בזהירות כדי למנוע זליגת נתונים. בנוסף, כל דוגמה נשענת על סביבת ריצה משלה ודוקר ייעודי, מה שהופך את ההרצה בפועל לכבדה ומסורבלת.

אותה משפחה

SWE-rebench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר הוא cc-by-4.0 שמתיר שימוש מסחרי בכפוף למתן ייחוס. עם זאת, הקוד עצמו מגיע מפרויקטים שונים בגיטהאב שלכל אחד רישיון עצמאי. יש לבדוק את שדה הרישיון של כל רשומה לפני שמכניסים אותה לאימון של מודל מסחרי.

האם יש במאגר תוכן בעברית?

לא. שפת המאגר היא אנגלית בלבד. כל הבעיות, התיאורים והקוד נאספו ממאגרים בינלאומיים ללא התאמה או תרגום לעברית.

איך המאגר נאסף?

הנתונים נאספו ישירות ממאגרי גיטהאב ציבוריים על ידי שליפת בעיות סגורות, תיאורי הפיאר והתיקונים שפתרו אותן. הדוגמאות נבדקו על מנת לוודא שיש בדיקות שנכשלות לפני התיקון ועוברות אחריו, ונוספו להן הערכות איכות ממודלי שפה.

במה הוא שונה מדאטהסטים אחרים לתכנות?

רוב המאגרים בתחום מתרכזים רק בפייתון. המאגר הזה מכיל עשרים שפות תכנות שונות ומספק סביבות הרצה ותצורות התקנה מדויקות כדי שיהיה אפשר לשחזר את הבדיקות בפועל.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הקריאה load_dataset והמזהה של המאגר. הנתונים שמורים בקובץ פרקט יחיד תחת פיצול train, ללא צורך בהרשאה מיוחדת או בקשת גישה. הקובץ מגיע מוכן להורדה ישירה. השדות המרכזיים שצריך לשים אליהם לב הם patch שמכיל את התיקון, problem_statement שמתאר את התקלה, ורשימות הטסטים בתוך FAIL_TO_PASS. מי שרוצה להריץ ולהעריך בפועל צריך לפנות למאגר הגיטהאב החיצוני של הפרויקט כדי להוריד את קובצי הדוקר והסקריפטים של הניתוח.

from datasets import load_dataset

ds = load_dataset("nebius/SWE-rebench-V2")

הרישיון

המאגר עצמו מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה כל עוד נותנים ייחוס הולם למחברים. עם זאת, כל דוגמה נלקחה מריפו נפרד בגיטהאב עם רישיון משלו, ולכן חייבים לבדוק את עמודת הרישיון בכל שורה. אם קוד המקור המקורי מוגבל ברישיון מגביל כמו קופי-לפט, זה יכול לחול על מודלים שמאמנים עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗