GPT
M

Multi-SWE-RL

קוד פתוח

ByteDance-Seedother2025-03-31

  • code

המאגר מרכז בעיות תוכנה אמיתיות מעשרות פרויקטי קוד פתוח מובילים, כולל מקרים שלא נכנסו לבנצ'מרק הרשמי. הוא מיועד למי שרוצה לאמן סוכני קוד בלמידת חיזוק בכמה שפות תכנות שונות.

  • 5,142הורדות בחודש
  • 37לייקים

מה זה

המאגר בנוי ממשימות הנדסת תוכנה שנאספו ממאגרי קוד פתוח מוכרים בגיטהאב, ומחולק לפי שפות תכנות בתיקיות ייעודיות: C, C++, Go, Java, JavaScript, Rust ו־TypeScript. הנתונים מגיעים משני מקורות עיקריים במסגרת האצווה הראשונה שנאספה בין יוני 2024 למרץ 2025. מקור אחד הוא משימות שנאספו לאימון למידת חיזוק וטרם תויגו, ומקור שני הוא מקרים שנפסלו מתוך Multi-SWE-bench ומופיעים בקובץ מזהים נפרד.

המבנה הפנימי מאורגן לפי פרויקטים ספציפיים, כאשר לכל פרויקט יש קובץ נפרד בפורמט jsonl. בין המאגרים שנכללים באיסוף אפשר למצוא את redis, zstd, caddy, express, tokio, ו־vue, כך שמדובר בקוד ממערכות אמיתיות עם סביבות עבודה מגוונות. הכרטיס לא מפרט תהליכי סינון אוטומטיים מעבר לעובדה שחלק מהמקרים הגיעו כתוצרי לוואי שנפסלו מהבנצ'מרק המרכזי.

מתאים ל

  • אימון סוכני קוד ב־RL

    שימוש ברשומות הקוד והבדיקות לאימון מודלים לפתרון תקלות תוכנה בלמידת חיזוק במספר שפות.

  • בניית סביבות סימולציה

    הקמת משימות בדיקה על בסיס בעיות אמיתיות שנאספו ממאגרי תשתית פופולריים כמו redis ו־tokio.

  • מחקר על דוגמאות קצה

    ניתוח המקרים שנפסלו מ־Multi-SWE-bench כדי להבין כשלים נפוצים בהערכת ביצועי מודלים.

איפה זה נופל

חלק משמעותי מהנתונים מוגדר מראש כלא מתויג, והחלק האחר כולל מקרים שנפסלו מהבנצ'מרק המקורי, מה שמעיד על איכות לא אחידה, משימות שעשויות להיות שבורות או בדיקות שלא עוברות. הנתונים מוגבלים לשבע שפות התכנות שנבחרו ואינם כוללים עברית כלל, שכן מדובר בקוד ובדיונים באנגלית מפרויקטים בינלאומיים. בנוסף, האיסוף מוגבל לחלון הזמן שבין יוני 2024 למרץ 2025, ולא תמצאו כאן תיעוד על אופן ההרצה של סביבות הבדיקה לכל פרויקט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

ByteDance שחררה את המאגר תחת תנאי CC0, אך המידע מבוסס על ספריות קוד פתוח חיצוניות. עליכם לבדוק את הרישיון הספציפי של כל פרויקט שממנו נלקחו הנתונים כדי לוודא עמידה בתנאים המסחריים שלו.

האם יש במאגר נתונים או קוד בעברית?

לא. המאגר נאסף מפרויקטי תוכנה בינלאומיים בגיטהאב כמו vue, caddy ו־zstd. שפת התיעוד, הדיונים והקוד היא אנגלית בלבד.

במה הוא שונה מ־Multi-SWE-bench הרגיל?

Multi-SWE-RL מיועד לאימון בלמידת חיזוק ולא רק להערכה, ולכן הוא כולל דאטה חדש שאינו מתויג. בנוסף, הוא מרכז בנפרד מקרים שנפסלו מהבנצ'מרק הראשי.

איך בנויים הקבצים במאגר?

המאגר כולל 131 קבצים, והנתונים מאורגנים בתיקיות לפי שפות תכנות כמו c, cpp, go, java, js, rust ו־ts. כל פרויקט שמור בקובץ jsonl נפרד.

איך טוענים

הורדת המאגר נעשית ישירות דרך שכפול באמצעות git clone, ודורשת התקנה מוקדמת של git-lfs כדי למשוך את הקבצים הגדולים. אין צורך בבקשת גישה מיוחדת או באישור כדי להוריד את המידע. הנתונים שמורים בקובצי jsonl לפי שפות ומאגרים, לצד קובץ בשם multi_swe_bench_discarded_instances.jsonl שמכיל את המקרים שנפסלו, אך הכרטיס אינו מתעד את הסכמה המדויקת של השדות בתוך הרשומות.

from datasets import load_dataset

ds = load_dataset("ByteDance-Seed/Multi-SWE-RL")

הרישיון

המאגר עצמו מפורסם ברישיון CC0 בכפוף לזכויות קניין רוחני של ByteDance, אך הנתונים מבוססים על פרויקטי מקור פתוח שונים. השימוש בכל קובץ כפוף לרישיון של המאגר שממנו הוא נלקח, מה שאומר שאימון מודל מחייב בדיקה של רישיונות המקור לכל פרויקט בנפרד לפני שימוש מסחרי.

הרישיון המלא ב־Hugging Face ↗