GPT
S

SWE-rebench-V2-PRs

קוד פתוח

nebiuscc-by-4.02026-02-04

  • code
  • software-engineering
  • swe-bench
  • pull-requests
  • nebius

מאגר ענק של pull requests אמיתיים מגיטהאב ביותר מ־16 שפות תכנות שונות. הוא מיועד למי שבונה או בוחן סוכני קוד וזקוק לנתוני פתרון בעיות עם בדיקות תוכנה מאמתות.

  • 10,022הורדות בחודש
  • 15לייקים

מה זה

המאגר כולל 126,300 רשומות שנאספו ממאגרי גיטהאב ציבוריים. כל רשומה מייצגת משימת הנדסת תוכנה שלמה סביב pull request אמיתי, כולל תיאור הבעיה המקורית, הדיף של התיקון, והדיף של בדיקות התוכנה שנוספו או שונו כדי לאמת אותו. מעבר לטקסט ולקוד, הנתונים כוללים רשימות מפורטות של טסטים שנכשלו לפני התיקון ועברו אחריו, לצד טסטים שהמשיכו לעבור כדי לוודא שאין רגרסיה.

המבחר רחב מאוד מבחינת שפות תכנות ולא מוגבל לפייתון בלבד. תמצאו כאן Go, JavaScript, TypeScript, Rust, Java, C, C++, Julia, Elixir, Kotlin, PHP, Scala, Clojure, Dart, OCaml ושפות נוספות. המאגר מגיע בחלוקה יחידה של train, ללא חלוקה מובנית מראש לחלקי בדיקה או ולידציה בתוך קובצי הפרקט עצמם.

לכל פריט מצורפים גם נתוני סביבה כמו קונפיגורציית התקנה לצורך שחזור הריצה, תיאור הממשק שהשתנה, והערות איכות שנוצרו על ידי מודלי שפה, מה שמקל על סינון מדויק לפי מורכבות.

מתאים ל

  • אימון סוכני קוד מרובי שפות

    אימון מודלים שצריכים לקבל תיאור תקלה בגיטהאב ולייצר את קוד התיקון המתאים במגוון שפות תכנות.

  • בנצ׳מרק אוטומטי להנדסת תוכנה

    בדיקת יכולת של מודלים לעבור טסטים אמיתיים שנכשלו לפני התיקון ועוברים לאחריו לפי רשימות הבדיקה המובנות.

  • מחקר על יצירת טסטים

    בחינת יכולות של מודלים לכתוב מקרי בדיקה מתאימים בעזרת שדה ה־test_patch שמתעד שינויי בדיקות בפועל.

איפה זה נופל

הטקסטים והתיעוד במאגר הם באנגלית בלבד ואין כאן עברית כלל, כפי שמקובל בפרויקטים בינלאומיים בגיטהאב. מעבר לכך, השדה meta כולל הערכות איכות שנוצרו על ידי מודלי שפה ולא על ידי בני אדם, מה שעלול להכניס הטיות או הזיות לא מבוקרות לתוך הסינון.

המאגר מספק קונפיגורציית התקנה אבל הרצת עשרות אלפי סביבות שונות מחייבת את דוקר וסביבות הריצה החיצוניות שהחוקרים פרסמו בנפרד, ולא הכל יעבוד מהקופסה בלי השקעה בתשתית בדיקה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

המאגר עצמו מחזיק ברישיון cc-by-4.0 שמתיר שימוש מסחרי תחת ייחוס, אך הקוד נאסף ממאגרים שונים עם רישיונות מגוונים. היוצרים צירפו את שדה license לכל רשומה כדי שתוכלו לסנן מראש קוד שרישיונו המקורי אינו מתאים לשימוש מסחרי. חובה לבדוק את השדה הזה לפני שמתחילים לאמן.

האם יש במאגר תמיכה בשפה העברית?

לא. המאגר מוגדר רשמית תחת השפה האנגלית בלבד, וכל תיאורי הבעיות וה־pull requests נלקחו ממאגרים בינלאומיים שמתנהלים באנגלית. הוא מתאים לפתרון בעיות קוד כלליות ולא למשימות שדורשות הבנת עברית.

מאיפה הגיעו הנתונים ואיך המאגר בנוי?

הנתונים נאספו מ־pull requests אמיתיים במאגרי גיטהאב ציבוריים במגוון שפות. המאגר מורכב משלושה קובצי parquet הכוללים 126,300 דוגמאות בפיצול train יחיד, עם מידע על התיקונים, הבעיות ובדיקות התוכנה.

מה מייחד אותו מדאטהסטים קודמים של SWE-bench?

המאגר מרחיב את הבדיקה מעבר לפייתון וכולל מעל 16 שפות תכנות שונות כמו Go, Rust, Java ו־TypeScript. בנוסף, הוא כולל מטא-דאטה מורחב על סביבות התקנה והערכות איכות שנועדו להקל על הרצת המשימות.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בפקודה אחת פשוטה, באמצעות ציון המזהה nebius/SWE-rebench-V2-PRs וה־split של train. אין צורך בבקשת גישה מיוחדת או באישור ידני, המאגר פתוח להורדה מיידית.

הקוד מחולק לשלושה קובצי parquet, כך שהטעינה יעילה יחסית. שימו לב במיוחד לשדות patch ו־test_patch שמכילים את השינויים בפועל, לשדה problem_statement שמשמש כקלט המרכזי למודל, ולשדות הבדיקות FAIL_TO_PASS שקריטיים לבניית סביבת ולידציה אוטומטית.

from datasets import load_dataset

ds = load_dataset("nebius/SWE-rebench-V2-PRs")

הרישיון

הדאטהסט מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מתאים ליוצרים. עם זאת, כל דוגמה נלקחה ממאגר קוד מקור ספציפי בגיטהאב שנושא רישיון משלו, ולכן הכרטיס מציין במפורש את הרישיון המקורי לכל שורה. אם אתם מאמנים מודל מסחרי, אתם חייבים לוודא שאינכם משתמשים בריפוז עם רישיונות מגבילים שאינם מתאימים ליעדים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗