GPT
G

gaia2

קוד פתוח

meta-agents-research-environmentscc-by-4.02025-09-09

  • agent-evaluation
  • multi-agent
  • benchmark
  • simulated-environment
  • temporal-reasoning

מאגר של 800 תרחישים דינמיים להערכת סוכני בינה מלאכותית בסביבה מדומה עם אילוצי זמן. הוא בודק יכולות מורכבות כמו תגובה לשינויים בזמן אמת, רעש, עמימות ושיתוף פעולה בין סוכנים.

  • 13,536הורדות בחודש
  • 46לייקים

מה זה

כל רשומה מייצגת תרחיש אינטראקטיבי הכולל מזהה, הגדרות רקע, אפליקציות זמינות וציר אירועים מתוזמן. הנתונים מתארים סביבות משתמש פיקטיביות, המכונות יקומים, ומכילים הודעות, אנשי קשר, יומנים ומדגם ערכים מוויקיפדיה. התרחישים לא מתעדים פעולות אנושיות אמיתיות אלא מבוססים על מידע סינתטי שנבנה בידי כותבים מקצועיים.

הבנייה נעשתה באמצעות ממשק גרפי ייעודי של שלד התוכנה של מטא, מתוך כוונה שלכל בעיה יהיה פתרון יחיד שניתן לבדיקה אוטומטית. תהליך הסינון כלל ארבעה שלבי אימות אנושיים שבהם בודקים בלתי תלויים פתרו את המשימות ללא צפייה בפתרון המקורי, לצד הסרת רמזים ואירועי הכרעה לטובת מנגנון הבדיקה.

המאגר מציע תצורות בדיקה ייעודיות לפי מיומנויות: תכנון וביצוע, חיפוש מידע, הסתגלות לשינויים, תזמון והבנת זמנים, והתמודדות עם עמימות, כשבכל קטגוריה יש 200 תרחישים. בנוסף קיימת תצורת מיני המכילה 200 תרחישים מכלל הקטגוריות לצורך הרצה מהירה, לצד תמיכה בהזרקת רעש ותקשורת בין סוכנים.

מתאים ל

  • בדיקת תפקוד סוכנים

    הרצת מודלים מול סביבה דינמית שמשתנה בזמן אמת עם תלות באירועים חיצוניים.

  • הערכת שיתוף פעולה

    מדידת היכולת של סוכן לתקשר עם סוכנים אחרים שמייצגים שירותים ואפליקציות.

  • עמידות להפרעות ורעש

    בחינת יכולת ההתאוששות של המודל כשמזריקים שגיאות או שינויים פתאומיים בסביבה.

איפה זה נופל

החומר מכיל נתונים באנגלית בלבד. כל הטקסטים והאינטראקציות נוצרו באופן מלאכותי באמצעות המודלים Llama 3.3 ו־Llama 4 Maverick, כך שאין כאן מורכבות של שיחות אנושיות אותנטיות או פערי ניסוח טיפוסיים בעברית. המערך כולל חלוקת ולידציה בלבד עם 800 תרחישים, והחוקרים מבקשים מפורשות שלא לאמן מודלים על הדאטה אלא להשתמש בו להערכה בלבד כדי לא לשרוף את מדד ההשוואה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הבסיסי הוא cc-by-4.0 ומתיר שימוש מסחרי עם ייחוס. עם זאת, הנתונים נוצרו באמצעות Llama 3.3 ו־Llama 4, ולכן אימון מודל והפצתו מחייבים אתכם לשלב את השם Llama בתחילת שם המודל שלכם לפי תנאי מטא.

האם יש במאגר נתונים בעברית?

לא. המאגר מתועד ומוגדר באנגלית בלבד. כל התרחישים, היישומים וההודעות המדומות מנוסחים באנגלית, כך שהוא לא מתאים לבדיקת יכולות לשוניות מקומיות.

האם אפשר להשתמש במידע כדי לאמן מודלים?

היוצרים מבקשים לא לאמן על הנתונים הללו כדי לשמור על אמינות הבנצ'מרק, שכן מדובר בפיצול ולידציה יחיד. בנוסף המשימה המוגדרת למאגר היא למידת חיזוק והערכה, והוא מיועד בעיקר כמבחן ביצועים לסוכנים.

איך נאספו התרחישים?

הנתונים אינם גרידה מהאינטרנט. הם נבנו בידי אנשי מקצוע שהשתמשו בממשק ייעודי על גבי עולמות מדומים שנוצרו במודלי שפה, כשכל תרחיש עבר סבב בדיקות של ארבעה בודקים שונים.

איך טוענים

הקבצים שמורים בפורמט Parquet בחלוקה לפי קונפיגורציות. מורידים אותם ישירות משרתי Hugging Face לאחר התחברות לחשבון דרך ממשק הפקודה, ואין צורך בהגשת בקשת גישה ידנית. הדרך הנוחה ביותר לעבוד עם המאגר היא דרך כלי הבנצ'מרק של מטא שניתן להריץ ישירות באמצעות uvx בלי התקנה מקומית, או בהתקנת חבילת פייתון ייעודית. בכל רשומה השדות המרכזיים שצריך לנתח הם id, scenario_id ומבנה הנתונים data שמכיל את מצב היישומים ואת מערך האירועים בזמן אמת.

from datasets import load_dataset

ds = load_dataset("meta-agents-research-environments/gaia2")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט מתאים. יחד עם זאת, מאחר שהנתונים הסינתטיים הופקו במודלים של מטא, הם כפופים לרישיונות של Llama 3.3 ו־Llama 4. המשמעות המעשית היא שאם תאמנו או תשפרו מודל על בסיס הנתונים האלה ותפיצו אותו, תחויבו להוסיף את המילה Llama בתחילת שמו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗