GPT
W

WildClawBench

קוד פתוח

internlmmit2026-03-24

  • agents
  • benchmark
  • evaluation
  • openclaw
  • multi-modal

שישים משימות קצה אל קצה לבדיקת סוכני בינה מלאכותית בסביבת הפעלה חיה של דוקר. המבחן בודק עבודה מורכבת ואמיתית כמו חיתוך וידאו, תיאום מיילים והגנה מהזרקות קוד.

  • 12,373הורדות בחודש
  • 70לייקים

מה זה

המאגר כולל שישים משימות שנבנו ידנית מאפס, המחולקות לשש קטגוריות: זרימת פרודוקטיביות, תכנות, אינטראקציה חברתית, חיפוש ושליפת מידע, יצירה מולטימודלית, ובטיחות.

במקום לקרוא לפונקציה מבודדת, הסוכן פועל מול מערכת הפעלה מלאה עם גישה לדפדפן, לטרמינל, לקבצים ולדואר אלקטרוני. המשימות דורשות שרשור של עשרות כלים לאורך זמן, כמו סריקת עשרות מאמרים או כתיבת קוד הרצה למודל מתוך תיעוד חסר.

המבחן תומך בארבע סביבות עבודה שונות: OpenClaw, Claude Code, Codex CLI ו־Hermes Agent. המבנה הזה מאפשר לבדוק את אותו המודל על פני מעטפות שונות ולהבדיל בין יכולת המודל לבין איכות התשתית שמפעילה אותו.

מתאים ל

  • הערכת סוכנים בסביבה חיה

    בדיקת יכולת המודל לפתור משימות ארוכות ומורכבות בעזרת כלי מערכת הפעלה ודפדפן.

  • השוואת מעטפות הרצה

    בדיקת אותו מודל על גבי ארבע סביבות שונות כדי להבין את השפעת התשתית על התוצאה.

  • בדיקת עמידות ובטיחות

    הערכת חסינות המודל מפני הזרקת הוראות זדוניות בקבצים וחשיפת מפתחות אבטחה בגיט.

איפה זה נופל

זה לא מאגר לאימון מודלים אלא סט הערכה בלבד. הוא תומך באנגלית ובסינית בלבד, ואין בו שום תמיכה או בדיקה של עברית.

חלק ממשימות החיפוש וההורדה נשענות על תוכן חי מיוטיוב ומהרשת, כך שחסימות בוטים ביוטיוב או שינויים באתרים יכולים לשבור את ההרצה. בנוסף, משימות רבות מכוונות לממשק OpenRouter ודורשות עריכה ידנית של קבצים אם רוצים לעבוד עם שרת מקומי עצמאי.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל?

לא. מדובר בסט מבחן של שישים משימות שמיועד להערכת ביצועים ולא לדאטהסט אימון. אם אתם מחפשים נתוני מסלולי ריצה לאימון, החוקרים פרסמו מאגר נפרד בשם WildClawBench-Trajectories.

האם יש במשימות תמיכה בעברית?

לא. המשימות והנתונים במאגר מנוסחים באנגלית ובסינית בלבד. המבחן אינו מודד הבנה, תרגום או תפעול כלים בעברית.

האם מותר להשתמש בו לצרכים מסחריים?

כן, הרישיון המדווח הוא MIT המאפשר שימוש מסחרי מלא. עליכם רק לשמור על תנאי הייחוס והודעת הרישיון המקורית.

מה נדרש כדי להריץ את המבחן מקומית?

דוקר פעיל, הורדת תמונות השרת של כמה ג'יגהבייט, וחיבורי רשת תקינים. תצטרכו גם מפתחות API לגישה למודלים דרך OpenRouter ומפתח לחיפוש של Brave.

איך טוענים

המאגר מכיל תמונות דוקר גדולות בפורמט tar וקבצי משימות בתיקיית workspace. מורידים אותם באמצעות huggingface_hub cli וטוענים לדוקר עם docker load.

קוד ההרצה יושב בגיטהאב. צריך להריץ סקריפט הכנה שמוריד סרטוני יוטיוב ומשקולות מודלים, ולהגדיר מפתחות API עבור OpenRouter ומנוע החיפוש Brave Search. אפשר להריץ את כל הסט או משימות בודדות.

from datasets import load_dataset

ds = load_dataset("internlm/WildClawBench")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובת שיתוף תחת אותו רישיון, ומותר להשתמש בתוצאות או בקוד לבניית מערכות מסחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗