GPT
A

APEX-SWE

קוד פתוח

mercorcc-by-4.02025-11-18

חבילת מבחנים להערכת סוכני קוד מול סביבות מורכבות ולא מול קבצי קוד מבודדים. יש פה משימות שדורשות תחקור שגיאות בלוגים וחיבור בין שירותי רשת פעילים.

  • 5,962הורדות בחודש
  • 26לייקים

מה זה

המאגר מורכב מחמישים משימות בדיקה עצמאיות, שמחולקות שווה בשווה לשני תחומים עיקריים. עשרים וחמש משימות אינטגרציה מעמידות סוכן מול שירותים חיים במכולות דוקר, כמו מערכות ניהול לקוחות, שרתי דואר, חנויות מקוונות והדמיות שירותי ענן. הסוכן צריך לאתר את הבקשה בלוח משימות, לאסוף הרשאות ולכתוב קוד פייתון שעובר סדרת בדיקות אוטומטיות.

החלק השני כולל עשרים וחמש משימות תצפית וניטור שמבוססות על באגים אמיתיים מפרויקטים פתוחים, בהם מאגרי בלוקצ'יין, כלי ניהול מסמכים ומערכות קונטיינרים. במשימות האלה הסוכן לא מקבל את הפתרון, אלא עותק של המאגר בזמן התקלה, קובצי שיחות בין מפתחים, לוחות ניהול משימות ושאילתות לוגים במערכות כמו גרפאנה ולוקי. המטרה שלו היא לאבחן את התקלה ולייצר טלאי קוד שמתקן את הבדיקות שנכשלו מבלי לשבור בדיקות קיימות.

מתאים ל

  • בחינת יכולות איתור באגים

    בדיקה אם סוכן פיתוח מסוגל לנתח לוגים ממערכות ניטור כדי לאתר תקלה אמיתית בקוד פתוח ולייצר תיקון תקין.

  • הערכת אינטגרציה בין שירותים

    מדידת ההצלחה של מודל בחיבור בין ממשקי תוכנה שונים והעברת מידע בין מאגרי נתונים ומערכות ניהול משימות.

  • בנצ'מרק לסוכני קוד מבוססי כלים

    השוואת ביצועים של סוכני תוכנה שמשתמשים בפרוטוקול שרתי הקשר כדי לתשאל סביבות פיתוח ומאגרי שיחות.

איפה זה נופל

חמישים משימות זה מדגם קטן מאוד להערכה מקיפה, והוא לא מתאים כלל לאימון מודלים מאפס אלא רק לבנצ'מרק נקודתי. המערכת נשענת בכבדות על ארכיטקטורת דוקר מרובת שירותים, מה שדורש משאבי מחשוב כבדים כדי להרים כל משימה. התוכן באנגלית בלבד ואין פה שום ביטוי לשפות אחרות או למערכות פיתוח מקומיות. בנוסף, הסתמכות על ממשקי תקשורת ספציפיים ופרוטוקול שרתי כלים מגבילה את המבחן רק לסוכנים שמתוכננים לעבוד מולם ישירות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

כן. הרישיון מאפשר שימוש מסחרי חופשי, כולל שינוי הנתונים ובניית מבחנים עבור מוצרים מסחריים. החובה היחידה היא מתן קרדיט ברור למפרסמים המקוריים של המאגר.

האם הדאטהסט כולל תמיכה בעברית?

לא. כל הקוד, תיעוד הממשקים, המשימות והשיחות שנאספו מתנהלים באנגלית בלבד. אם המוצר שלכם מיועד להתמודד עם הנחיות בעברית, המאגר הזה לא יספק לכם אינדיקציה רלוונטית.

איך המידע הזה נאסף ונבנה?

משימות התצפית מבוססות על באגים היסטוריים אמיתיים שנלקחו ממאגרי קוד פתוח מובילים, יחד עם לוגים ושיחות מפתחים שנשמרו מהאירועים. משימות האינטגרציה נבנו כתסריטים שמדמים פעילות הנדסית יומיומית מול שירותי רשת כמו מאגרי לקוחות ומערכות כרטיסים.

במה הוא שונה ממבחני קוד רגילים כמו מבחני פייתון מבודדים?

במקום לתת לפונקציה קלט ולבדוק פלט, כאן הסוכן רץ בתוך רשת דוקר שלמה עם שירותים חיים. הוא צריך לקרוא נתונים מלוח משימות, לתשאל שרתי לוגים, לתקשר עם ממשקי רשת ולוודא שהקוד שהוא מייצר עובד מול תשתית מלאה.

איך טוענים

המאגר מכיל מעל שלושים וארבעה אלף קבצים, והגישה אליו פתוחה לחלוטין ללא צורך באישור מראש. כדי להוריד את המידע צריך להשתמש בתוסף גיט לקבצים גדולים, אחרת קובצי הלוגים והשיחות ירדו ריקים. המבנה מאורגן בתיקיות נפרדות לכל משימה, שכוללות קובצי הגדרות דוקר, תיעוד ממשקים, נתוני פתיחה ובדיקות פייתון. הרצת המבחנים עצמם וחישוב הציונים מתבצעים באמצעות כלי הרצה ייעודי שנמצא במאגר גיטהאב חיצוני של המפתחים.

from datasets import load_dataset

ds = load_dataset("mercor/APEX-SWE")

הרישיון

המאגר מופץ תחת רישיון קריאייטיב קומונס ייחוס 4.0. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, לשנות אותם ולשלב אותם בכלים אחרים, בתנאי שנותנים קרדיט מלא למפרסמים ומציינים אם נעשו שינויים. הרישיון חל על נתוני המבחנים עצמם, ולא כופה שיתוף באותו רישיון על מודלים או מוצרים שנבדקו באמצעותו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗