GPT
T

terminal-bench-2.0

קוד פתוח

harborframeworkapache-2.02026-02-13

  • benchmark
  • agents
  • terminal
  • code
  • evaluation

בנצ'מרק שמציב סוכני תוכנה ומודלי שפה בתוך סביבות דוקר כדי לבצע משימות אמיתיות כמו פתרון פרצות אבטחה, דיבאגינג או הרכבת חלבונים. מי שבונה סוכנים אוטונומיים צריך בדיקה מעשית מבוססת הרצה, ולא רק שאלות רב-ברירה.

  • 64,434הורדות בחודש
  • 49לייקים

מה זה

המאגר מכיל פחות מאלף רשומות, אבל כל רשומה היא למעשה תיקיית משימה שלמה ולא סתם שורת טקסט. כל משימה כוללת קובץ הגדרות סביבה מסוג Dockerfile, קובץ הנחיות instruction.md, סקריפט בדיקה להערכה, ולעתים קרובות גם פתרון מוכן מראש לבדיקת שפיות וקבצים מוצפנים.

המשימות מייצגות עבודה ממשית של אנשי פיתוח ומחקר בטרמינל: דיבאג לקוד אסינכרוני, אבטחת מידע או עיבוד נתונים מדעיים. לפי יוצרי המאגר, כל משימה עברה מספר שעות של ולידציה ידנית וממוחשבת כדי לוודא שהיא פתירה, מציאותית ומוגדרת בלי ערפול.

המאגר הנוכחי בהאגינג פייס הוא עותק קריאה בלבד שסונכרן ישירות מגיטהאב. המקור מנוהל בריפו חיצוני, והקבצים הבינאריים עברו כאן המרה לפורמט Git LFS כדי להתאים לדרישות האחסון של האתר.

מתאים ל

  • בדיקת ביצועי סוכנים

    הרצת סוכן אוטונומי בתוך קונטיינר מבודד כדי למדוד יכולת לפתור בעיות תכנות ואבטחה מורכבות.

  • אימון באמצעות RL

    יצירת מסלולי הרצה בסביבת טרמינל לצורך אופטימיזציה ולמידת חיזוק של מודלים.

  • ולידציה של כלי פיתוח

    בדיקת עמידות ויעילות של סוכני קוד מבוססי מודלים מסחריים מול פתרונות ידועים מראש.

איפה זה נופל

הנתונים כולם באנגלית ומיועדים אך ורק להרצה בתוך קונטיינרים, כך שאין כאן שום ייצוג למשימות בעברית או למערכות הפעלה שאינן לינוקס סטנדרטי. מספר המשימות קטן יחסית, פחות מאלף, מה שאומר שהוא מתאים מאוד כבנצ'מרק לבדיקת יכולות אבל לא מספיק כדי לאמן מודל מאפס בלי דאטה נוסף. בנוסף, מדובר במשימות קשות ומורכבות שמצריכות זמן ריצה משמעותי וכוח מחשוב מקומי לכל הרצה, בניגוד להערכות טקסטואליות פשוטות ומהירות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על תנאי הייחוס של הרישיון המקורי.

האם יש במאגר הזה תוכן או משימות בעברית?

לא. כל ההנחיות, המשימות וסביבות הבדיקה מוגדרות באנגלית בלבד ומבוססות על שורת פקודה בלינוקס.

איך המשימות האלה נאספו ונבחנו?

היוצרים בנו את המשימות עבור סביבות דוקר כדי לבדוק יכולות של מודלים מתקדמים. לפי התיעוד שלהם, כל משימה עברה מספר שעות של תיקוף ידני ובדיקה עם מודלי שפה כדי להבטיח שהיא מציאותית וניתנת לפתרון.

האם צריך לטעון את הדאטהסט דרך הספרייה הרגילה של Hugging Face?

לא מומלץ. הדאטהסט הזה הוא מראה מגיטהאב שמיועדת להרצה ישירה דרך כלי ייעודי בשם Harbor שמנהל את הקונטיינרים ובודק את התוצאות.

איך טוענים

אין צורך באישור גישה או ברישום מיוחד. זה לא דאטהסט טבלאי רגיל שטוענים בכמה שורות של פנדס, אלא חבילת משימות שמריצים ישירות מול כלי הניהול Harbor דרך שורת הפקודה. הכלי מושך את המשימות אוטומטית, מקים עבורן קונטיינרים ומריץ את הסוכן שבחרתם, בין אם זה סוכן בדיקה מקומי או מודל מסחרי דרך API. חשוב לוודא שיש לכם דוקר פעיל ומספיק משאבי חישוב להרצת מספר קונטיינרים במקביל.

from datasets import load_dataset

ds = load_dataset("harborframework/terminal-bench-2.0")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המוכר. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות את הקבצים ולהפיץ אותם מחדש, בכפוף לשמירה על הצהרת זכויות היוצרים והרישיון המקורי. השימוש בו לצורך הערכה של מודל או סוכן מסחרי אינו מגביל את הרישוי של המוצר שתפתחו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗