GPT
C

Claw-Eval

קוד פתוח

claw-evalmit2026-03-25

  • agent-bench
  • evaluation
  • real-world
  • multimodal

מאגר מבחנים שנועד לבדוק איך סוכני בינה מלאכותית מתמודדים עם משימות מורכבות. הוא מאפשר לבחון יכולות ביצוע מקצה לקצה בעולם האמיתי במקום מדדי טקסט רגילים.

  • 3,820הורדות בחודש
  • 32לייקים

מה זה

המאגר מכיל 300 משימות שונות שמחולקות לשלושה חלקים עיקריים. החלק המרכזי כולל 161 משימות כלליות שמכסות 24 תחומים שונים, ובהם תקשורת, פיננסים, תפעול ופרודוקטיביות. החלק המולטימודלי מחזיק 101 משימות שדורשות תפיסה ויצירה, כמו הפקת דפי אינטרנט, שאלות ותשובות על סרטונים וחילוץ נתונים ממסמכים. החלק השלישי מורכב מ־38 משימות מרובות שלבים, שבהן הסוכן מנהל שיחה מול דמות משתמש מדומה כדי לחדד דרישות ולתת ייעוץ.

המשימות עצמן מבוססות על שילוב והתאמה של מבחנים קיימים מקהילת הקוד הפתוח, כולל פרויקטים כמו OpenClaw, PinchBench, OfficeQA, OneMillion-Bench, Finance Agent ו־Terminal-Bench 2.0. כל רשומה במאגר כוללת מזהה ייחודי, הוראת ביצוע, רשימת קבצים נדרשים, שפת המשימה ותחום התוכן שלה.

מתאים ל

  • בדיקת סוכני שירות וייעוץ

    הרצת משימות שיחה מרובות שלבים כדי למדוד איך הסוכן מברר פרטים חסרים מול לקוח.

  • הערכת יכולות מולטימודל

    מדידת הדיוק של המודל בחילוץ נתונים מתוך מסמכים, ניתוח וידאו והפקת דפי רשת.

  • מבחן ביצוע למשימות תפעול

    בדיקת יכולת הסוכן לפעול על קובצי עזר ולפתור משימות בתחומי פיננסים ותפעול.

איפה זה נופל

גודל המאגר זעיר ועומד על 300 משימות בלבד, כך שהוא מתאים להערכה ממוקדת ולא לאימון מודלים. הנתונים קיימים רק באנגלית ובסינית, ללא תמיכה בעברית. בנוסף, משימות מרובות שלבים מסתמכות על סימולציה של משתמש, שלא תמיד משקפת אינטראקציה אמיתית ומבולגנת של בני אדם בשטח.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הנתונים פורסמו תחת רישיון MIT שמאפשר שימוש מסחרי חופשי, כל עוד שומרים על הודעת זכויות היוצרים של המפתחים המקוריים.

האם יש במאגר משימות בעברית?

לא. המאגר מוגדר ותומך בשתי שפות בלבד, אנגלית וסינית. לא תמצאו בו נתונים מקומיים או תמיכה מובנית בשפה העברית.

מאיפה הגיעו הנתונים של המשימות?

היוצרים התבססו על שילוב והתאמה של מבחנים מוכרים בתחום הסוכנים. בין המקורות נכללים OpenClaw, PinchBench, OfficeQA, OneMillion-Bench, Finance Agent ו־Terminal-Bench 2.0.

האם המאגר מתאים לאימון של מודל?

לא. מדובר בבנצ'מרק של 300 משימות בלבד שמיועד להערכת ביצועים ולא לאימון. כדי לאמן מודלים נדרש היקף דאטה גדול בהרבה.

איך טוענים

טוענים את הנתונים ישירות בעזרת הפקודה load_dataset מספריית datasets של Hugging Face, ללא צורך בהרשאה מיוחדת. אפשר למשוך את כל המאגר יחד או לציין פיצול ספציפי מתוך general, multimodal או multi_turn. המידע הטבלאי שמור בקובצי Parquet קטנים, ובנוסף קיים קובץ מכווץ בשם fixtures.tar.gz שמכיל את קובצי העזר הנדרשים לביצוע המשימות. השדות החשובים לעבודה הם query שמגדיר את ההוראה, fixture שמפרט אילו קבצים יש לחבר לסוכן, ו־category לסינון לפי תחום.

from datasets import load_dataset

ds = load_dataset("claw-eval/Claw-Eval")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בלי חובה לשחרר את הנגזרות באותו רישיון. נדרש רק לשמור על תנאי הרישיון וציון הקרדיט ליוצרים, ומודל שנבדק עליו אינו כפוף למגבלות שימוש מסחריות מצד המאגר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗