GPT
C

chi-bench

קוד פתוח

actavaapache-2.02026-05-03

  • benchmark
  • agents
  • healthcare
  • clinical
  • prior-authorization

סביבת בדיקה מורכבת לסוכני בינה מלאכותית בתהליכי בריאות וביטוח בארצות הברית. היא מציבה משימות ארוכות טווח מול סימולטור של עשרים יישומים רפואיים ומדד הערכה קפדני.

  • 5,577הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל קובצי הגדרה ועולמות מדומים לבדיקת סוכנים בשלושה תחומים מרכזיים. 25 משימות עוסקות בקליטת הפניות ואישורי טיפול מצד המרפאה, 25 בבחינת שימוש ואישורים מצד המבטח, ו־25 בניהול רצף טיפולי של חולים. בנוסף יש 23 משימות זירה מקצה לקצה שבהן שני סוכנים מתקשרים זה מול זה, ועוד 3 משימות מרתון שמחברות את כל התרחישים של תחום שלם לרצף אחד.

המבנה של כל משימה מוגדר מראש בקובצי ג'ייסון שקובעים את המדיניות הרפואית, את התוצאה המצופה, את מסלול ההחלטה ואת תפקיד הסוכן. הנתונים מתבססים על סימולציה של עשרים שירותי רפואה שמופעלים דרך פרוטוקול MCP, ובדיקת התוצאות נשענת על שילוב של אימות מצב דטרמיניסטי ושופט מבוסס מודל שפה.

מתאים ל

  • מבחן סוכנים לאישורי טיפול

    בדיקת יכולת של סוכן לנתח תיק רפואי ולהכין בקשת אישור מוקדם מול דרישות מבטח.

  • בחינת שימוש בצד המבטח

    מדידת ביצועים של מודלים במיון פניות, ביקורת אחיות ורופאים, וקבלת החלטות כיסוי.

  • ניהול תוכניות טיפול

    מעקב אחרי מטופלים עם מחלות כרוניות, בניית תוכנית טיפול והתאמתה לרמת שיתוף הפעולה.

  • זירת משא ומתן בין סוכנים

    הערכת שני סוכנים עצמאיים שמנהלים יחד את מחזור ההגשה והאישור בין מרפאה למבטח.

איפה זה נופל

התוכן מותאם כולו למערכת הבריאות והביטוח האמריקאית, באנגלית בלבד. הכללים הרגולטוריים, תהליכי האישור המוקדם והאינטראקציה בין מבטח לספק שונים לחלוטין ממה שקורה בישראל, כך שזה לא יעזור להערכת תהליכים מול קופות חולים מקומיות. נקודת תורפה משמעותית היא התלות המלאה במאגר הנוהל הנפרד, שאינו חופשי להורדה ישירה ודורש אישור. מעבר לזה, הביצועים של מיטב המודלים במבחן הזה נמוכים מאוד, מה שמעיד על עומס קיצוני שמכשיל סוכנים קיימים.

שאלות
נפוצות

האם הדאטהסט כולל תמיכה בעברית?

לא, כל החומרים כתובים באנגלית בלבד. הם מתמקדים במונחים קליניים ובירוקרטיים של עולם הרפואה בארצות הברית. כדי לבחון מערכות ישראליות תצטרכו לבנות סביבה שתואמת את הנהלים המקומיים.

האם אפשר להשתמש בו ישירות לפיתוח מסחרי?

הקבצים במאגר הזה פתוחים לשימוש מסחרי תחת רישיון אפאצ'י 2.0, אבל בפועל אי אפשר להריץ אותם ללא מדריך ההפעלות שמוגן ברישיון שונה. המדריך מופץ במאגר נפרד עם תנאי גישה קליניים, ולכן עליכם לוודא שהתנאים שם מאפשרים את הפעילות העסקית שלכם. מומלץ לבדוק את הרישוי הכפול לפני שמתחילים.

מה נדרש כדי להריץ את המשימות במאגר?

מלבד הורדת הקבצים מכאן, חובה לקבל אישור גישה למאגר המדריך הנפרד. בנוסף תצטרכו להתקין דוקר, סביבת פייתון עדכנית וכלי הרצה מגיטהאב, לצד מפתח גישה של אנתרופיק הדרוש למודל השיפוט. רק לאחר הגדרת כל הרכיבים הללו המערכת תוכל להריץ בדיקה מלאה.

איך בנויות המשימות מבפנים?

כל משימה כוללת קובץ הגדרות שמציין את המקרה הקליני, מסמכי המדיניות הרלוונטיים והמדדים להצלחה. במהלך הריצה הסוכן פועל מול סימולטור שמחקה עשרים אפליקציות רפואיות בעזרת קריאות כלים. בסיום, מנגנון משולב בודק אם הסוכן ביצע את הפעולות הנדרשות וקיבל את ההחלטה הנכונה.

איך טוענים

טוענים את הקבצים בעזרת כלי השורה של האגינג פייס אל תיקיית נתונים מקומית, רצוי לפי גרסה מדויקת. המאגר עצמו כולל 2,505 קבצים ופחות מאלף רשומות, אבל אי אפשר להריץ שום משימה בלעדיו ובלי ספר הנהלים שמופץ במאגר נפרד וסגור. תצטרכו להגיש בקשת גישה עבור המדריך, להחזיק מפתח של אנתרופיק לצורך מודל השיפוט, ולהתקין את כלי ההרצה ממאגר הגיטהאב באמצעות דוקר ופייתון 3.12 ומעלה.

from datasets import load_dataset

ds = load_dataset("actava/chi-bench")

הרישיון

המאגר הנוכחי מופץ תחת רישיון אפאצ'י 2.0 שמתיר שימוש מסחרי, שינוי והפצה, בכפוף לשמירה על הודעת זכויות היוצרים והרישיון המקורי. אפשר להשתמש בנתונים כדי לבחון מודלים מסחריים. עם זאת, מדריך ההפעלה שמחייב את הרצת המשימות מופץ בנפרד תחת רישיון שיתוף קליני מוגבל, ולכן השימוש בסביבה השלמה מותנה בתנאי אותו מאגר נוסף.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗