GPT
S

SWE-rebench-openhands-trajectories

קוד פתוח

nebiuscc-by-4.02025-09-22

  • code
  • synthetic
  • tools
  • agents
  • software

המאגר מרכז מעל 67 אלף ריצות של סוכן בינה מלאכותית שניסה לפתור תקלות אמיתיות מגיטהאב. הוא שימושי למי שרוצה לאמן מודלים על תהליכי הסקת מסקנות ארוכים בעולם פיתוח התוכנה.

  • 3,920הורדות בחודש
  • 141לייקים

מה זה

הרשומות מייצגות ריצות של שלד התוכנה OpenHands בגרסה 0.54.0, כשהוא מופעל על גבי המודל Qwen3-Coder-480B-A35B-Instruct. הריצות מתעדות ניסיונות לפתרון בעיות קוד אמיתיות מתוך 1,823 מאגרים שונים שנלקחו מהמאגר SWE-rebench. כל שורה בנתונים מחזיקה את היסטוריית השיחה המלאה בין המערכת, הסוכן והסביבה, לצד התיקון הסופי בפורמט דיף ובדיקה בינארית אם המשימה נפתרה בהצלחה.

מתוך 67,074 ריצות במאגר, 32,161 מוגדרות כמוצלחות, והן מתפרסות על פני 3,792 תקלות שנפתרו בפועל. אורך הריצות מגיע לממוצע של 64.3 תורות ועד למקסימום של 100 תורות לריצה. הנתונים כוללים שדות ייחודיים שבודקים את איכות הטסטים שהסוכן עצמו יצר, כולל האם הם נכשלו לפני התיקון ועברו אחריו.

מתאים ל

  • אימון סוכני קוד מבוססי SFT

    לימוד מודלים לתכנת ולבצע תיקוני באגים מורכבים על בסיס עשרות אלפי מסלולי פתרון מוצלחים.

  • למידת חיזוק ודירוג מסלולים

    שימוש בריצות שנכשלו ובאלו שהצליחו כדי לאמן מודלי תגמול או לבצע אימון מסוג DPO לסוכני פיתוח.

  • ניתוח כתיבת בדיקות אוטומטיות

    חקר יכולת הסוכן לייצר טסטים שמאמתים פתרון בעיות, בעזרת המדדים הייעודיים שנאספו במאגר.

איפה זה נופל

כל הנתונים נוצרו על ידי מודל בודד, Qwen3-Coder בגרסת 480B, בתוך סביבת עבודה אחת ספציפית של OpenHands. התוצאה היא הטיה ברורה לדפוסי הפעולה ולפורמט הפקודות של הכלי הזה בלבד. המשימות נשענות על קוד פתוח אמיתי מגיטהאב, כך שאין כאן כיסוי לשפות שאינן אנגלית בקוד ובתיעוד, ואין ייצוג לפרויקטים בעברית. יותר ממחצית מהריצות במאגר לא הצליחו לפתור את התקלה, ולכן מי שמחפש רק דוגמאות חיוביות יצטרך לסנן את הנתונים באופן יזום.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא בנתונים, כולל אימון מודלים המיועדים למכירה או להטמעה במוצר סגור. התנאי היחיד הוא מתן ייחוס מתאים ליוצרי המאגר.

איך הנתונים נאספו בפועל?

החוקרים הריצו את המודל Qwen3-Coder-480B-A35B-Instruct בתוך מסגרת העבודה של סוכן OpenHands מול בעיות אמיתיות מגיטהאב. הריצה תיעדה את כל שלבי ההסקה, פקודות הסביבה, קריאות הכלים והתוצאות עד להגעה לפתרון או לעצירה.

האם יש במאגר תמיכה בעברית?

לא. הנתונים מתבססים על מאגרי קוד ציבוריים ותקלות מגיטהאב, שכולם מנוהלים וכתובים באנגלית. אין במאגר טקסטים, הערות קוד או תיעוד בעברית.

במה הוא שונה מדאטהסטים אחרים של SWE-bench?

הוא מתבסס על בעיות אמיתיות ולא סינתטיות, מקיף 1,823 מאגרים שונים ומציג ממוצע גבוה של כשישים וארבעה צעדים לריצה. בנוסף, הוא כולל מעקב ייחודי אחר בדיקות קוד שהסוכן כתב בעצמו.

איך טוענים

הנתונים מוגשים בקובץ trajectories.parquet יחיד, פתוח להורדה ישירה בלי צורך בבקשת אישור גישה מיוחדת. לצד קובץ הפרקט תמצאו במאגר גם קובצי הגדרות כמו config.toml ו־tools.json. השדות המרכזיים לעבודה הם trajectory שמכיל את רצף הצעדים והתצפיות מהסביבה, model_patch שמכיל את הקוד הסופי, והשדה resolved שמסמן הצלחה. שימו לב שהארגומנטים בקריאות הכלים בתוך היסטוריית השיחה נשמרו כטקסט פשוט כדי לחסוך מקום, ולכן תידרשו להמיר אותם בחזרה למבנה נתונים לפני אימון כדי לשמור על תבנית שיחה אחידה.

from datasets import load_dataset

ds = load_dataset("nebius/SWE-rebench-openhands-trajectories")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של המידע, ללא חובה לשתף את התוצרים באותו הרישיון. הדרישה העיקרית היא מתן קרדיט ברור ליוצרים. אם אתם מאמנים מודל על בסיס הנתונים האלה, הרישיון עצמו לא מגביל את השימוש במודל שנוצר, כל עוד עמדתם בתנאי הייחוס של הדאטהסט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗