GPT
H

healthbench-professional

קוד פתוח

openaimit2026-04-21

  • health
  • healthbench

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

המאגר מרכז שיחות קליניות מול רופאים יחד עם רובריקות בדיקה מפורטות. הוא מתאים למי שרוצה למדוד ביצועים של מודלי שפה בעולם הרפואי מול תשובות אנושיות אמיתיות.

  • 2,323הורדות בחודש
  • 61לייקים

מה זה

הנתונים בנויים סביב שיחות רפואיות שמסתיימות בפניית משתמש, לצד תשובה מלאה שכתב רופא. לכל מקרה מוצמדת רשימת קריטריונים עם ניקוד מוגדר לצורך הערכה. השיחות מחולקות לשלושה תחומי שימוש: ייעוץ, כתיבה או מחקר רפואי. מבחינת אופי הפנייה, הנתונים מתפצלים לשיחות שנערכו בכוונת מכוון מול בדיקות חדירות ובטיחות.

רופאים דירגו את רמת הקושי של כל מקרה לפי סולם ליקרט, שמחלק את המקרים לטיפוסיים או קשים. בנוסף, כל רשומה כוללת שיוך להתמחות הרפואית הרלוונטית. המפרסמים לא מסרו פרטים על תהליך הסינון או המקורות הראשוניים שמהם גויסו הרופאים והשיחות, אך הם מחזיקים סט בדיקה פרטי נוסף כדי לזהות זליגה של הנתונים לאימונים עתידיים.

מתאים ל

  • הערכת מודלים רפואיים

    בדיקת איכות התשובות של מודלי שפה לפי קריטריונים ורובריקות שקבעו רופאים.

  • בחינת עמידות ובטיחות

    מדידת התנהגות המודל מול מקרי בדיקת עמידות קליניים שמטרתם לאתגר את המערכת.

  • כיול שופט מבוסס מודל

    השוואת ציונים של מודל שופט חיצוני אל מול ציוני הרופאים והקריטריונים המובנים.

איפה זה נופל

הטקסטים בכרטיס באנגלית ואין כל עדות לקיומן של שפות אחרות, כולל עברית, או להתאמה למערכת הבריאות המקומית בישראל. מעבר לכך, המפרסמים מבקשים במפורש לא לחשוף דוגמאות גולמיות ברשת כדי למנוע זיהום של מודלים עתידיים, ואף שתלו מחרוזת מזהה לצורך סינון. חסר כל מידע על פיזור ההתמחויות, מספר הרופאים שהשתתפו, או תאריכי האיסוף המקוריים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

כן, הרישיון הרשמי הוא MIT ולכן אין מגבלה משפטית על שימוש מסחרי. יחד עם זאת, היוצרים מבקשים לא להעלות את הנתונים לרשת ולא להכניס אותם למאגרי אימון כדי למנוע פגיעה באיכות ההערכה.

האם יש בדאטהסט תמיכה בעברית?

לא, כל המידע שפורסם בכרטיס הוא באנגלית. מי שבונה מוצר לרפואה בישראל יצטרך לבדוק התאמה מקומית ותרגום עצמאי של המושגים והקריטריונים.

מה מייחד את המאגר הזה בהשוואה למאגרי שאלות רפואיים?

הוא כולל שיחות מלאות ולא רק שאלות בודדות, ובנוסף מכיל תשובה שנכתבה בידי רופא ורשימת קריטריונים עם ניקוד. הדגש כאן הוא על בדיקת מודלים במשימות ייעוץ, כתיבה ומחקר לפי סטנדרט קליני מוגדר.

איך מריצים הערכה מול הנתונים האלה בפועל?

אופנוואיי לא צירפה קוד הרצה רשמי, אבל מפנה לפרויקט simple-evals בגיטהאב כמימוש ייחוס. הרעיון הוא לתת למודל שפה להעריך את התשובה מול הקריטריונים והתשובה האנושית שמופיעים בקובץ.

איך טוענים

המידע יושב בקובץ jsonl בשם healthbench_professional_eval.jsonl לצד קובץ התיעוד, ללא צורך באישור גישה מקדים או בהרשמה מיוחדת. אתם מורידים את הקובץ ישירות וטוענים אותו עם ספריית הנתונים המועדפת עליכם או בקריאת שורות פשוטה בפייתון.

בכל רשומה תצטרכו לעבד את שיחת המקור, את רשימת קריטריוני הבדיקה והניקוד שלהם, ואת שדות הסיווג כמו תחום ההתמחות ורמת הקושי. אופנוואיי לא שחררה קוד הערכה רשמי פנימי, אבל מפנה למימוש בגיטהאב של סימפל-איוואלס כבסיס להרצת בדיקות עם מודל שופט.

from datasets import load_dataset

ds = load_dataset("openai/healthbench-professional")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון, ומחייב רק שמירה על הודעת זכויות היוצרים. עם זאת, היוצרים מבקשים מפורשות לא לאמן על הנתונים ולא לפרסם דוגמאות גלויות כדי לשמור על תוקף הבדיקה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗