GPT
L

Long-Horizon-Terminal-Bench

קוד פתוח

IntelligenceLabapache-2.02026-07-13

  • agents
  • llm-agents
  • terminal
  • long-horizon
  • benchmark

מאגר של 46 משימות מסוף מורכבות שמודד ביצועי סוכנים לאורך מאות צעדים בתוך קונטיינר. הוא מיועד למי שרוצה לבדוק עמידות של סוכן בעבודה מתמשכת ולא במענה נקודתי.

  • 7,887הורדות בחודש
  • 132לייקים

מה זה

המאגר כולל 46 רשומות בלבד, כשכל רשומה מייצגת משימת מסוף מלאה. הנתונים מחולקים לתיקיות משימה שמכילות קובץ הגדרות, הוראות טקסטואליות לסוכן, וסביבת דוקר עם קבצי הפעלה ותשתיות כמו משחקים או כלי פיתוח. המשימות מחולקות לקטגוריות שכוללות הנדסת תוכנה, משחקים ומשימות מולטימודליות.

קובץ הנתונים המרכזי מרכז את המטא-דאטה של כל משימה, כולל מזהה, קטגוריה, רמת קושי, משאבי חומרה נדרשים כמו מעבד, זיכרון וכרטיס מסך, וזמני ריצה מוקצבים לסוכן ולמומחה אנושי. המשימות נבנו כדי לבחון עבודה רציפה בסביבה ששומרת מצב לאורך זמן.

מתאים ל

  • מדידת סוכני קוד ארוכי טווח

    בדיקת יכולת של סוכן אוטונומי לפתור תקלות תוכנה מורכבות הדורשות עשרות פקודות מסוף רציפות.

  • הערכת עמידות בפני שגיאות

    בחינת יכולת הסוכן לקבל משוב מהרצה שנכשלה ולהמשיך לעבוד עד תום הזמן המוקצב.

  • השוואת ביצועים בסביבות מבודדות

    הרצת סוכנים שונים מול סביבות דוקר זהות כדי לקבל ציון השוואתי מדויק לפי משימות המאגר.

איפה זה נופל

המאגר מכיל 46 משימות בלבד וכולן באנגלית, כך שאין כאן כיסוי סטטיסטי רחב או תמיכה בריבוי שפות. הוא לא מתאים לאימון מודלים אלא רק להערכה ובדיקת ביצועים.

החיסרון המרכזי הוא שהמאגר מפורסם ללא קובצי הבדיקות והפתרונות המלאים, שנשמרו בחוץ בכוונה כדי למנוע זיהום של נתוני אימון. כדי לבדוק ציונים באופן רשמי צריך להשתמש בבדיקות החיצוניות או לפנות למפתחים, ובלי גרסת הרצה מותאמת של כלי ההרצה חלק מהמשימות ייעצרו מוקדם מדי ויקבלו ציון נמוך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0 שמתיר שימוש מסחרי מלא. התנאי המרכזי הוא שמירה על תנאי הרישיון המקוריים ומתן ייחוס ליוצרים.

האם המאגר כולל תמיכה בעברית?

לא. כל ההוראות, המשימות והסביבות מוגדרות בשפה האנגלית בלבד, ואין במאגר נתונים בעברית.

למה חסרים קבצים בתיקיות המשימה?

היוצרים השמיטו בכוונה את קובצי הפתרונות ואת הבדיקות שמחשבות את הציון כדי למנוע דליפה של המבחנים לאימוני מודלים עתידיים. כדי להריץ בדיקה מלאה יש צורך לבקש גישה או להשתמש במערכת ההרצה של הפרויקט.

במה הוא שונה ממאגרי בדיקה רגילים של כתיבת קוד?

רוב המאגרים בודקים יצירת קוד בצעד בודד. כאן הסוכן נכנס למערכת הפעלה חיה, מבצע שינויים, מריץ פקודות ומקבל משוב חוזר עד שהמשימה מושלמת או שהזמן נגמר.

איך טוענים

טוענים את קובץ המשימות באמצעות פקודת load_dataset הרגילה של ספריית datasets עם השם IntelligenceLab/Long-Horizon-Terminal-Bench, תחת הקונפיגורציה tasks וספליט test. הקובץ המרכזי הוא קובץ jsonl פשוט ולא דורש הרשאות גישה מיוחדות.

כדי להריץ ולהעריך את המשימות בפועל מפעילים כלי בשם Harbor ומריצים קונטיינרים מבוססי Docker. חשוב לשים לב שרבות מתמונות הדוקר דורשות ארכיטקטורת linux/amd64, כך שבמחשבים מבוססי ARM תצטרכו להגדיר את הפלטפורמה ידנית.

from datasets import load_dataset

ds = load_dataset("IntelligenceLab/Long-Horizon-Terminal-Bench")

הרישיון

המאגר משוחרר תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומחייב מתן קרדיט ושמירה על הודעת הרישיון המקורית. הרישיון אינו כופה שיתוף באותו רישיון עבור פיתוחים נגזרים. מודל שנבדק או אומן על הנתונים אינו מחויב ברישיון פתוח, אך יש לעמוד בתנאי הייחוס של המאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗