GPT
A

AgentWorldBench

קוד פתוח

Qwenapache-2.02026-06-22

  • world-model
  • agent
  • benchmark
  • evaluation
  • environment-simulation

יש כאן גם סקירה על Qwen עצמו.

המאגר כולל מסלולי פעולה אמיתיים של סוכני בינה מלאכותית מול סביבות מחשב, לצד תגובות אמת שנלכדו ישירות מהמערכות. הוא נועד למי שרוצה לבחון יכולת סימולציה וחיזוי של תגובות מערכת בעולם האמיתי.

  • 1,478הורדות בחודש
  • 104לייקים

מה זה

הנתונים מחולקים לשבעה קובצי JSONL לפי תחומים: שרתי פרוטוקול MCP, מנועי חיפוש, מסופי פקודה, סביבות פיתוח תוכנה, ממשקי מערכת ההפעלה אנדרואיד, דפי אינטרנט וסביבות שולחן עבודה. בסך הכל המאגר מציג 2,170 דגימות הערכה מתוך מסלולים מרובי צעדים, עם ממוצע של 22.8 צעדים למסלול. החלק הגדול ביותר שייך לתחום פיתוח התוכנה עם 472 דגימות, והתחומים הקטנים ביותר הם אנדרואיד, ווב ומערכות הפעלה עם 200 דגימות כל אחד.

המקור מבוסס על ריצות אמיתיות של מודלי חזית מול בנצ'מרקים קיימים, כולל Tool Decathlon, Terminal-Bench ו־OSWorld-Verified. כל רשומה כוללת מזהה מסלול, רשימת פעולות שנשלחו לפי סדר הצעדים, רשימת תגובות סביבה מאומתות שנאספו בזמן אמת, הוראת מערכת מתאימה ואינדקס המציין את נקודת ההערכה הנוכחית. האיבר האחרון ברשימת התגובות משמש כאמת המוחלטת שאליה משווים את תחזית המודל.

מתאים ל

  • הערכת סימולציית מסוף

    בדיקת היכולת של מודל לנחש פלט של פקודות לינוקס ושינויים במערכת הקבצים לאורך זמן.

  • בחינת תגובות כלי MCP

    מדידת דיוק החיזוי של תוצאות קריאה לכלים, שאילתות בסיסי נתונים ופרוטוקולי שרת.

  • חיזוי שינויי ממשק ווב

    בדיקה האם המודל מסוגל לחזות עדכוני DOM אחרי לחיצות ואינטראקציות בדפדפן.

איפה זה נופל

כל הנתונים במאגר הם באנגלית ובפורמטים טכניים של קוד, שאילתות, פקודות מערכת ו־DOM. אין כאן ייצוג לממשקים או טקסטים בעברית. בנוסף, מדובר במאגר הערכה בלבד עם כמות קטנה של 2,170 דגימות בסך הכל, כך שהוא לא מספק נפח שמאפשר אימון מודלים מאפס אלא בדיקת ביצועים נקודתית. שיטת הציון נסמכת על שיפוט של מודל חיצוני לפי חמישה ממדים, מה שעלול לייצר תלות והטיות באיכות המודל השופט.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, הרישיון המוגדר הוא apache-2.0, שמאפשר שימוש מסחרי מלא כולל הערכה ופיתוח של מוצרים. התנאי העיקרי הוא הכללת הצהרת הרישיון והקרדיט המקורי במסגרת הפצת התוצר. אין חובה לשתף את הקוד או את המודלים שתפתחו תחת אותו רישיון.

האם יש בדאטהסט תמיכה בעברית?

לא, הנתונים מתועדים כולם באנגלית בלבד. כל פקודות המערכת, תוצאות החיפוש, ממשקי ה־DOM והאינטראקציות בנויים סביב סביבות טכניות סטנדרטיות באנגלית. אם המוצר שלכם פועל מול ממשקים בשפה העברית, תצטרכו לאסוף נתונים ייעודיים באופן עצמאי.

איך נאספו הנתונים במאגר?

הנתונים נלכדו בזמן אמת מריצות של מודלי חזית על גבי בנצ'מרקים מוכרים כמו Tool Decathlon ו־OSWorld. כל אינטראקציה של סוכן מול מערכת הפעלה, דפדפן או שרת הופעלה בסביבה חיה. תגובת האמת נשמרה ישירות מתוך הפלט שהחזיר המחשב.

במה המאגר הזה שונה ממאגרי פעולות רגילים של סוכנים?

בניגוד למאגרים שבודקים אם סוכן בחר את הפעולה הנכונה, כאן בודקים את מודל העולם עצמו. המטרה היא לחזות בדיוק איך הסביבה תגיב לפעולה נתונה מתוך ההיסטוריה המצטברת. הציון מתבסס על השוואת החיזוי לתגובת אמת אמפירית שנלכדה מהמערכת בחמישה ממדי איכות.

איך טוענים

הקבצים יושבים ישירות במאגר ללא צורך באישור גישה מראש. מורידים את קובצי ה־JSONL הרלוונטיים לתחום המבוקש וטוענים אותם באמצעות סקריפט הערכה ייעודי שמריץ הסקת מסקנות, שופט חיצוני מבוסס מודל וחישוב ציונים סופי. בעבודה עם הנתונים חשוב לשים לב לשדות prompt ו־response שהם רשימות מקבילות, כאשר response האחרון הוא התוצאה המדויקת שצריך לחזות מול הפעולה ב־current_prompt.

from datasets import load_dataset

ds = load_dataset("Qwen/AgentWorldBench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, מחקרי ופרטי ללא תשלום, ומאפשר שינוי ושילוב של הנתונים במוצרים שונים. חובה לשמור על הודעת זכויות היוצרים המקורית והפניה לרישיון בכל הפצה. תוצרים או מודלים שמשתמשים בדאטהסט אינם מחויבים לפתוח את הקוד שלהם באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗