GPT
T

terminal-bench-2-verified

קוד פתוח

zai-orgapache-2.02026-02-05

גרסה מתוקנת של מבחן הביצועים Terminal-Bench 2.0 לסוכני קוד. המאגר מנקה תקלות בסביבות הדוקר ובמבחנים כדי למנוע קריסות של סוכנים שלא קשורות ליכולת שלהם.

  • 30,731הורדות בחודש
  • 82לייקים

מה זה

זהו אוסף משימות להערכת סוכני תוכנה ומודלים בסביבת שורת פקודה אמיתית, שנוצר בעקבות בדיקה מקיפה של Terminal-Bench 2.0 על ידי Zhipu AI בשיתוף אנשי Stepfun. המאגר כולל 864 קבצים המאורגנים לפי משימות נפרדות. בכל תיקיית משימה תמצאו קובץ הוראות instruction.md, הגדרת סביבה ב־Dockerfile, סקריפטים לבדיקה tests/test.sh, פתרונות solve.sh וקובץ task.toml.

הצוות תיקן סביבות דוקר ב־89 משימות כדי לפתור קריסות של סוכן Claude Code, שקרס בגלל היעדר פקודות מערכת בסיסיות או חריגות זיכרון. בנוסף תוקנו פערים בין ההוראות למבחנים ב־11 משימות, ובסבב בדיקה מאוחר יותר שוכתבו מבחנים פגומים בארבע משימות שהכשילו פתרונות נכונים, לצד עדכון הוראות בעוד שתי משימות וסנכרון תיקונים מול הגרסה הרשמית של Terminal-Bench 2.1.

מתאים ל

  • הערכת סוכני טרמינל

    בדיקת ביצועים אמינה של סוכני קוד כמו Claude Code בסביבת לינוקס ללא קריסות תשתיתיות.

  • אימות פתרונות קוד

    בחינת יכולות של מודלים בהרצת כלי שורת פקודה, קימפול פרויקטים ופתרון באגים במערכת מבודדת.

  • השוואת הרצות של סוכנים

    מדידת ההשפעה של תיקוני סביבה וניסוחי הוראות מול תוצאות רשמיות של מודלים כמו GLM-5 וקלאוד.

איפה זה נופל

יוצרי המאגר עצמם קובעים שהמבחן כבר לא מתאים למדידת המודלים החדשים ביותר, כיוון שרובם עברו התאמת יתר אליו או התיישרו לפי פתרונות שגויים. הם ממליצים במפורש שלא לבחון מודל שכבר עבר ציון 85, ולעבור ל־Terminal-Bench 3.0. כמו כן, חמש משימות מכילות קובצי תמונה ווידאו, ועבור מודלים ללא ראייה ממוחשבת כמו GLM-5 נדרשה הוספת אזהרה מפורשת שלא לפתוח קבצים אלו כדי למנוע הזיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים והרצת מבחני ביצועים למערכות מסחריות. התנאי המרכזי הוא שמירה על הצהרת הרישיון ומתן ייחוס ליוצרים המקוריים.

האם הדאטהסט כולל תמיכה או נתונים בעברית?

לא. כל ההוראות, המשימות, סקריפטי הבדיקה וסביבות הטרמינל כתובים באנגלית בלבד. התיעוד מלווה גם בגרסה בסינית, אך אין במאגר טקסטים או משימות בעברית.

מה ההבדל בין גרסה זו לבין Terminal-Bench המקורי?

הגרסה הזו מתקנת באגים קריטיים בסביבות Docker שמנעו מסוכנים כמו Claude Code לרוץ עקב מחסור בחבילות בסיסיות. בנוסף תוקנו מבחנים שפסלו פתרונות תקינים ונוסחו מחדש הוראות מעורפלות.

האם כדאי להשתמש במאגר הזה להערכת המודלים הכי חזקים כיום?

היוצרים ממליצים שלא לעשות זאת אם המודל כבר מקבל ציון מעל 85. מודלים מתקדמים כבר הגיעו להתאמת יתר למשימות האלה, וההמלצה של הצוות היא להעריך אותם על Terminal-Bench 3.0.

איך טוענים

אין כאן קובץ נתונים יחיד של טקסט או טבלה, אלא תיקיות קוד, סקריפטים ואימג'ים של דוקר. המאגר פתוח להורדה ישירה ללא צורך באישור גישה. האימג'ים של הדוקר נבנו מראש ופורסמו למאגר ציבורי ב־Docker Hub תחת המשתמש xiangyangli, עם הפניה מוגדרת מראש בתוך קובצי task.toml של כל משימה, כך שאין חובה לבנות את המכולות מחדש כדי להתחיל להריץ.

from datasets import load_dataset

ds = load_dataset("zai-org/terminal-bench-2-verified")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושימוש פנימי, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקוריות ומציינים שינויים שבוצעו. אימון או הערכת מודלים באמצעות הנתונים מותרים לחלוטין לכל מטרה, ואין חובה לשחרר מודלים או קוד נגזר תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗