GPT
E

EnterpriseOps-Gym

קוד פתוח

ServiceNow-AIapache-2.02026-02-28

מאגר משימות להערכת סוכני בינה מלאכותית בסביבות ארגוניות מורכבות. הוא בודק ביצוע של תהליכים מרובי שלבים מול מסדי נתונים ושרתי כלים, עם בדיקת תוצאה סופית בבסיס הנתונים ולא רצף פעולות קשיח.

  • 15,425הורדות בחודש
  • 99לייקים

מה זה

המאגר כולל משימות שנבנו על ידי מומחים ומכסות שמונה תחומים תפעוליים בארגון: לוח שנה, שירות לקוחות, ניהול קבצים, דואר אלקטרוני, משאבי אנוש, ניהול שירותי מחשוב, תקשורת ארגונית ומשימות היברידיות שמשלבות כמה תחומים יחד. כל רשומה מייצגת משימה מלאה ומכילה מזהה, הגדרת תחום, הנחיית מערכת שכוללת מדיניות והגבלות גישה, הוראה למשתמש, רשימת כלים זמינים, הגדרות התחברות לשרתי כלים ואימות תוצאה שמבוסס על שאילתות בדיקה.

הסביבות עצמן רצות בתוך מכולות ומבוססות על בסיסי נתונים סינתטיים שמכילים 164 טבלאות עם קשרי מפתחות זרים מורכבים. המשימות מחולקות לקבוצות שונות לפי תחום, ומוגדרות בתצורות כלי עבודה שנעות בין חשיפת הכלים המדויקים הנדרשים למשימה ועד הוספת כלי הסחה אקראיים כדי לבדוק יכולת סינון של הסוכן.

מתאים ל

  • מדידת ביצועי סוכנים

    בדיקת יכולת התכנון וקריאת הכלים של מודלים שונים בתהליכים ארגוניים עם תלויות רבות.

  • עמידות לרעש בבחירת כלים

    השוואת ביצועי הסוכן בין מצב של חשיפת כלים נדרשים בלבד למצבים שכוללים כלי הסחה מרובים.

  • פיתוח מנגנוני תזמור

    בחינה והשוואה של ארכיטקטורות תזמור שונות מול משימות שמחייבות עמידה במדיניות הרשאות.

איפה זה נופל

הנתונים כולם סינתטיים ומנוהלים באנגלית בלבד. אין כאן תמיכה בעברית או התאמה לתהליכים עסקיים מקומיים, והתשתית מניחה מבנה ארגוני גלובלי טיפוסי. מעבר לזה, המאגר דורש הרצה חיה של מכולות ובסיסי נתונים, כך שאי אפשר להשתמש בו להערכה סטטית פשוטה של שאלות ותשובות. הקשר הממוצע עומד על עשרות אלפי טוקנים למשימה, מה שמייקר ומסבך מאוד את הבדיקות מול מודלים חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים והטמעתם במוצרים מסחריים. הדרישה העיקרית היא לכלול את עותק הרישיון והודעת זכויות היוצרים.

האם הנתונים מתאימים למערכות הפועלות בעברית?

לא, המשימות, הנחיות המערכת והכלים מנוסחים באנגלית בלבד. אם המוצר שלכם מיועד לתפעול ארגוני בעברית, המאגר לא ישקף את האתגרים הלשוניים של המערכת.

איך המאגר בודק אם הסוכן הצליח במשימה?

במקום לבדוק אם הסוכן פעל ברצף צעדים מסוים, המערכת מריצה שאילתות בדיקה מול מסד הנתונים לאחר סיום הפעולות. הציון נקבע לפי מצב הנתונים הסופי בלבד.

במה המאגר שונה ממבחני ביצועים רגילים של סוכנים?

רוב המבחנים מסתמכים על טקסט סטטי או התאמת מחרוזות. כאן מדובר בסביבה מבוססת מכולות עם מאות טבלאות ומאות כלים חיים, שבה הסוכן משנה נתונים בפועל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון על ידי ציון שם המאגר, התצורה המבוקשת כמו oracle, ושם התחום הרצוי. הקבצים שמורים בפורמט פרקט ואינם דורשים אישור גישה מקדים או הרשמות מיוחדות. כדי להריץ את ההערכה בפועל לא מספיק להוריד את הרשומות, יש צורך להרים את תשתית המכולות של השרתים לפי ההגדרות בשדה gym_servers_config ולהריץ את שאילתות האימות מול מסד הנתונים בסיום התהליך.

from datasets import load_dataset

ds = load_dataset("ServiceNow-AI/EnterpriseOps-Gym")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושילוב במערכות סגורות, ללא חובת שיתוף של פיתוחי המשך באותו רישיון. תנאי השימוש דורשים רק שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית. מודלים שאומנו או הוערכו על המאגר אינם מוגבלים בשימוש מסחרי על פי תנאי הרישיון הזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗