GPT
M

MemoryAgentBench

קוד פתוח

ai-hyzmit2025-07-05

  • llm-agents
  • memory
  • benchmark
  • skills

בנצ'מרק שבודק איך סוכני בינה מלאכותית מנהלים זיכרון לאורך זמן באינטראקציות מרובות תורות. הוא מיועד למי שבונה סוכנים ורוצה לבחון יכולות אחזור, עדכון מידע שמשתנה והבנה של הקשרים ארוכים.

  • 9,636הורדות בחודש
  • 39לייקים

מה זה

המאגר מחולק לארבעה חלקים עיקריים שמשקפים יכולות זיכרון נפרדות: אחזור מדויק, למידה בזמן בדיקה, הבנה לטווח ארוך ופתרון קונפליקטים במידע. הנתונים מבוססים על שילוב של מאגרים קיימים שעברו התאמה לצד שתי הרכבות חדשות, EventQA שבוחן רצף אירועים וחיזוי ברומנים, ו־FactConsolidation שבודק התמודדות עם עדכון עובדות ישנות ברמות קושי של קפיצה אחת ומספר קפיצות.

המבנה של כל דגימה בנוי סביב קטעי טקסט שמדמים שיחה מתמשכת, בשיטה שבה טוענים טקסט פעם אחת ושואלים עליו מספר שאלות. החוקרים סיננו דגימות יקרות ולא יעילות, מחקו חלקים כמו ruler_niah, והוסיפו תת-מדגם של DetectiveQA לצד שינויים במזהים של צמדי השאלות והתשובות.

מתאים ל

  • בדיקת מערכות RAG

    הערכת יכולת האחזור של רכיבי זיכרון מתוך היסטוריית שיחה עמוסה מול שאילתות מורכבות.

  • מדידת עדכון עובדות

    בחינת היכולת של סוכן לזהות מידע ישן שאינו תקף ולהחליף אותו בנתונים חדשים.

  • ניתוח הקשר רחב

    בדיקה אם הסוכן מבין תמונה כוללת של שיחות ממושכות ולא רק שולף מקטעים בודדים.

איפה זה נופל

הטקסטים כולם באנגלית ואין כאן תמיכה בעברית או בכל שפה אחרת. המחברים מודים שהנתונים עדיין לא נאספו משיחות אמת אותנטיות אלא בעיקר מהתאמות סינתטיות ורומנים, כך שהם לא משקפים התנהגות משתמשים אמיתית בעולם האמיתי. בנוסף, המשימה של פתרון קונפליקטים מורכבים מתגלה כצוואר בקבוק קשה מדי, כשאפילו מודלים מובילים מגיעים שם לדיוק של 7% בלבד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, המאגר זמין תחת רישיון MIT. הרישיון מתיר שימוש מסחרי חופשי, כל עוד כוללים את הודעת הרישיון והזכויות המקורית של היוצרים.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, וכל המשימות מבוססות על מקורות אנגליים.

איך הנתונים נאספו ונבנו?

החוקרים שילבו מאגרים קיימים שעברו עיבוד עם שתי הרכבות חדשות משלהם. כל המידע פוצל למקטעים כדי לחקות צבירת שיחה בשלבים.

במה הוא שונה ממאגרי הערכה רגילים למודלי שפה?

הוא מתמקד ספציפית בזיכרון של סוכנים דרך שיחות מרובות שלבים. במקום בדיקת הקשר סטטי, הוא בוחן עדכון עובדות ולמידה תוך כדי ריצה.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face בלי צורך באישור גישה. הקבצים שמורים בפורמט Parquet בחלוקה לפי ארבע המשימות המרכזיות, לצד קובץ entity2id.json, ומכילים בין 10 ל־100 מיליון רשומות בסך הכל. שדות המפתח כוללים את qa_pair_ids, נקודות מפתח בפיצול ההבנה לטווח ארוך, ואת question_ids שמשמש במשימת Longmemeval.

from datasets import load_dataset

ds = load_dataset("ai-hyz/MemoryAgentBench")

הרישיון

המאגר מופץ תחת רישיון MIT, שזה הרישיון הכי פתוח שיש. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. הרישיון לא מגביל שחרור של מודלים שאומנו או הוערכו באמצעותו ולא דורש פתיחת קוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗