GPT
E

eva

קוד פתוח

ServiceNow-AImit2026-03-24

  • voice-agents
  • evaluation
  • benchmark
  • spoken-dialogue
  • airline

המאגר כולל חמישים תרחישי שירות לקוחות בתעופה לבחינת סוכנים קוליים. הוא נבנה כדי לבדוק במקביל גם את הדיוק התפעולי וגם את איכות השיחה בדיבור.

  • 60הורדות בחודש
  • 71לייקים

מה זה

הנתונים כוללים חמישים תרחישים קונקרטיים מעולם התעופה, כמו שינוי טיסות עקב שיבושים, ביטולים, טיפול בשוברים, מעבר לרשימות המתנה והתמודדות עם משתמשים בעייתיים. כל רשומה מייצגת סימולציה מוגדרת היטב, ומכילה את מטרת המשתמש, אופי וסגנון הדיבור שלו, מהלך השיחה הצפוי, מצב בסיס הנתונים ההתחלתי של התרחיש, ומצב היעד הסופי של הנתונים שאליו הסוכן אמור להגיע לאחר ביצוע הפעולות.

התרחישים נוצרו באופן סינתטי באמצעות מודלים של OpenAI ממשפחת GPT-5 ותוכננו בכוונה כך שלא תמיד ניתן לרצות את הלקוח במלואו, מה שמאלץ את הסוכן לנהל משא ומתן. מצב היעד הסופי נבנה בעזרת סימולציות של GPT-5.2 medium עם מודל שאימת את קריאות הכלים, ועבר בדיקות אנושיות מרובות. לאחר מכן נערך תיקוף נוסף באמצעות הרצות חוזרות של מודלים מובילים כמו Claude Opus 4.6 ו־Gemini 3 Pro כדי לוודא שהתרחישים אכן פתירים ועקביים.

מתאים ל

  • הערכת סוכנים קוליים

    מדידת יכולת הסוכן לפתור תרחישי שיחה קוליים מורכבים תוך שמירה על דיאלוג טבעי ותמציתי.

  • בדיקת שימוש בכלים

    בחינה אם הסוכן מבצע שאילתות ועדכונים נכונים מול בסיס הנתונים של התרחיש בהתאם לבקשות הלקוח.

  • ולידציית ניהול משא ומתן

    בדיקת התנהגות המערכת במצבים שבהם אי אפשר לספק למשתמש את מבוקשו ויש להציע חלופות מוגדרות.

איפה זה נופל

ההגבלה הבולטת ביותר היא הגודל, המאגר מכיל חמישים תרחישים בלבד בתחום הטיסות, ולכן הוא מיועד כבנצ׳מרק להערכה ולא לאימון מודלים. הנתונים כולם באנגלית ומבוססים על ייצור סינתטי, כך שאין כאן שגיאות דיבור אמיתיות, רעשי רקע, מבטאים מורכבים או קולות ישראליים. בנוסף, חוקי התרחישים קשיחים יחסית ונבדקו מול כלים ייעודיים, כך ששימוש בתחומים אחרים או בכלים שונים ידרוש התאמה ידנית משמעותית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון הוא MIT ולכן מותר להשתמש בנתונים ובקוד לבדיקה או פיתוח של מוצרים מסחריים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית.

האם יש במאגר תמיכה בעברית?

לא. הנתונים כולם נוצרו באנגלית ומתאימים כרגע רק להערכת שיחות ותרחישים בשפה הזו.

האם המאגר כולל שיחות טלפון מוקלטות של בני אדם?

לא, אין כאן הקלטות אמיתיות. התרחישים ומצבי בסיס הנתונים יוצרו בצורה סינתטית באמצעות מודלי שפה ונבדקו ידנית על ידי בני אדם כדי לוודא דיוק.

האם אפשר להשתמש במאגר לאימון מודל?

לא מומלץ. עם חמישים תרחישים בלבד, המאגר קטן מדי לאימון ונועד לשמש ככלי בדיקה והערכה לסוכנים קוליים.

איך טוענים

המאגר ציבורי ופתוח להורדה ישירה ללא צורך בהרשאות מיוחדות. הנתונים שמורים בקובץ data/airline.parquet, כך שניתן לטעון אותם בקלות באמצעות כל ספריית נתונים סטנדרטית כמו pandas. השדות המרכזיים שצריך לשים אליהם לב הם user_goal שמגדיר את עץ ההחלטות של המשתמש, initial_scenario_db שמכיל את נתוני הטיסות וההזמנות ההתחלתיים בפורמט JSON, ו־ground_truth שמגדיר איך מסד הנתונים צריך להיראות בסוף התהליך כדי לקבוע אם הסוכן הצליח במשימתו.

from datasets import load_dataset

ds = load_dataset("ServiceNow-AI/eva")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לגמרי, כולל שימוש מסחרי, שינוי הקוד והנתונים, ושילוב במוצרים קנייניים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. מודלים שנבדקים או מאומנים מול הנתונים אינם מחויבים ברישוי פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗