GPT
M

Multi-SWE-bench

קוד פתוח

ByteDance-Seedother2025-03-31

  • code

מאגר לבדיקת פתרון תקלות קוד אמיתיות בשבע שפות תכנות שונות במקום פייתון בלבד. הוא מכיל 1,632 מקרים שנבחרו בקפידה מפרויקטים פופולריים של קוד פתוח.

  • 12,479הורדות בחודש
  • 42לייקים

מה זה

המאגר מכיל 1,632 דוגמאות שנבחרו מתוך 2,456 מועמדים על ידי 68 בודקים אנושיים מומחים. המטרה היא להרחיב את מבחן SWE-bench מעבר לעולם של פייתון, אל סביבות פיתוח מגוונות הכוללות שפות מערכת, שפות ווב וסביבות צד שרת.

הנתונים נאספו מריפוזיטוריז ציבוריים בולטים בגיטהאב כמו zstd, Catch2, grpc-go, axios, tokio ו־material-ui. כל מקרה מייצג תקלה אמיתית שנפתרה בפועל בקוד המקור של הפרויקט הרלוונטי.

החלוקה הפנימית מסודרת לפי תיקיות של שבע שפות: C, C++, Go, Java, JavaScript, Rust ו־TypeScript. בכל תיקייה ישנם קובצי jsonl נפרדים עבור כל פרויקט שנבדק.

מתאים ל

  • בנצ'מרק למודלי קוד

    בדיקת יכולת המודל לפתור באגים אמיתיים ב־Rust, C++, Go ושפות נוספות.

  • אימון סוכני פיתוח

    כוונון עדין של סוכני תוכנה שפועלים על סביבות קוד מורכבות בשפות מגוונות.

  • השוואת ביצועים רב לשונית

    מדידת פער האיכות של מודל יחיד בין שפות ווב לשפות מערכת נמוכות.

איפה זה נופל

הנתונים מוגבלים לשבע שפות בלבד ולמספר מצומצם של ספריות וסביבות קוד פתוח מפורסמות. לא תמצאו כאן שפות ישנות, קוד ארגוני פנימי או פייתון. בנוסף, המאגר לא מכיל תמיכה בטקסט בעברית, והוא נשען על קוד ותיאורי תקלות באנגלית בלבד. הכרטיס אינו מפרט תאריכי חיתוך מדויקים של התקלות, כך שייתכן שחלק מהנתונים כבר זלגו לסט האימון של מודלים קיימים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

זה מורכב ותלוי בפרויקט הספציפי. החוקרים שחררו את העיבוד תחת CC0, אבל הנתונים עצמם נלקחו מעשרות ספריות קוד פתוח שונות, ולכל אחת יש רישיון משלה שחובה לבדוק בנפרד.

במה המאגר הזה שונה מ־SWE-bench המקורי?

ההבדל המרכזי הוא מגוון השפות. בעוד שהבנצ'מרק המקורי מתמקד בעיקר בפייתון, כאן נבדקות שבע שפות שונות בהן C, Rust, Go ו־TypeScript.

האם יש במאגר דוגמאות או תקלות בעברית?

לא. כל הנתונים נאספו ממאגרי גיטהאב בינלאומיים של ספריות קוד פתוח פופולריות, ולכן כל תיאורי התקלות, ההערות והקוד כתובים באנגלית.

איך נאספו וסוננו הרשומות במאגר?

הצוות אסף 2,456 מועמדים לתקלות ממאגרים ציבוריים בגיטהאב. מתוכם, 68 מומחים אנושיים בדקו ואימתו את הנתונים עד לבחירת 1,632 מקרים אמינים.

איך טוענים

טוענים את המאגר ישירות בעזרת git clone מ־Hugging Face, אך חובה לוודא שתוסף git-lfs מותקן במחשב לפני כן. המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. הקבצים שמורים בפורמט jsonl המחולקים לפי שפות ופרויקטים, כאשר מבנה השדות הפנימי בכל רשומה מפורט במסמכי המאגר המקוריים.

from datasets import load_dataset

ds = load_dataset("ByteDance-Seed/Multi-SWE-bench")

הרישיון

המאגר מוגדר ברישיון CC0 מטעם המפרסמים, אך כפוף לזכויות קניין רוחני של ByteDance ולרישיונות המקוריים של כל פרויקט קוד פתוח שמופיע בו. המשמעות היא שאין רישיון אחיד, ועליכם לוודא שהרישיון של כל ספריה שממנה נלקח המידע מתיר שימוש מסחרי או אימון מודלים.

הרישיון המלא ב־Hugging Face ↗