GPT
M

MedHallu

קוד פתוח

UTAustin-AIHealthרישיון לא דווח2025-02-19

בנצ'מרק לבדיקת הזיות של מודלי שפה בשאלות ותשובות רפואיות. הוא מציע השוואה ישירה בין תשובות אמיתיות לתשובות שגויות שנוצרו במיוחד לצורכי בדיקה.

  • 4,179הורדות בחודש
  • 24לייקים

מה זה

המאגר מבוסס במלואו על PubMedQA, דאטהסט מוכר של שאלות ותשובות מתוך ספרות ביו-רפואית. החוקרים לקחו את השאלות המקוריות ובנו סביבן מבחן שנועד לבדוק אם מודל מסוגל לזהות מתי תשובה רפואית מכילה הזיה ומתי היא נכונה. כל רשומה כוללת שאלה רפואית, תשובת אמת, תשובה עם הזיה, רמת קושי וסיווג של סוג ההזיה.

הנתונים מחולקים לשני חלקים ברורים. החלק הראשון נקרא pqa_labeled והוא מכיל 1,000 דוגמאות איכותיות שמתבססות על החלק המתויג ידנית של PubMedQA. החלק השני נקרא pqa_artificial והוא כולל 9,000 דוגמאות שנוצרו באמצעות תהליך אוטומטי, על בסיס הפיצול המלאכותי של המקור.

מתאים ל

  • בחינת מודלי שפה ברפואה

    בדיקה אם מודל שפיתחתם מצליח להבדיל בין עובדות רפואיות מוכחות לבין סילופים.

  • אימון מסווגי הזיות

    שימוש בזוגות התשובות כדי ללמד מודל ביקורת לזהות פלט שגוי בתחום הביו-רפואי.

  • ניתוח סוגי שגיאות

    הערכת ביצועים לפי קטגוריית ההזיה ורמת הקושי שמוגדרות בכל רשומה.

איפה זה נופל

כל הטקסטים כאן באנגלית בלבד ומבוססים על תקצירי מחקרים אקדמיים, כך שהם לא משקפים שיחות טבעיות של מטופלים או תיקים רפואיים קליניים. בנוסף, תשעת אלפים מתוך עשרת אלפים הרשומות הופקו בתהליך אוטומטי, מה שעלול להכניס שגיאות שיטתיות או הזיות לא מציאותיות שאינן משקפות טעויות של בני אדם. אם אתם בונים שירות בעברית או מנסים לתפוס שגיאות בניסוח חופשי של רופא, הבנצ'מרק הזה לא מייצג את הבעיה שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

בגוף התיעוד מצוין רישיון MIT, שמאפשר שימוש מסחרי ללא מגבלות מיוחדות מלבד מתן קרדיט. עם זאת, בפרטי הדאטהסט הרשמיים בראש העמוד לא מוגדר רישיון, ולכן צוות משפטי שמרן עשוי לדרוש הבהרה ישירה מהחוקרים לפני שילובו בפיתוח מסחרי.

האם המאגר כולל עברית?

לא, המאגר מבוסס על מאמרים מ־PubMed וכולו באנגלית בלבד. אם המוצר שלכם פועל מול קהל ישראלי ומשתמש בשפה העברית, תצטרכו לתרגם את הנתונים או להשתמש בו רק לבדיקת יכולות ההסקה של המודל באנגלית.

מה המשקל של הקבצים וכמה זמן לוקח להוריד אותם?

המאגר כולל עשרת אלפים שורות טקסט בסך הכל, והוא שמור בשני קובצי parquet בודדים. מדובר בנפח של מגה-בייטים בודדים, כך שההורדה לוקחת שניות בודדות ולא דורשת מקום אחסון משמעותי או חומרה מיוחדת.

איך נוצרו הנתונים שבפנים?

הבסיס הוא מאגר PubMedQA המוכר. החוקרים חילקו את העבודה לאלף דוגמאות איכותיות שמתבססות על תיוג אנושי, ותשעת אלפים דוגמאות נוספות שנבנו באמצעות תהליך אוטומטי כדי לייצר הזיות מכוונות לצד התשובות הנכונות.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets בפייתון באמצעות load_dataset עם המזהה UTAustin-AIHealth/MedHallu. אין צורך בבקשת גישה או אישור מיוחד, והקבצים שמורים בפורמט parquet קל משקל. מכיוון שיש שני תתי-מאגרים שונים, צריך לציין בקריאה אם רוצים לטעון את pqa_labeled או את pqa_artificial. השדות המרכזיים שתרצו לבדוק בכל שורה הם שאלת המקור, התשובה הנכונה, התשובה המומצאת, וסיווג ההזיה.

from datasets import load_dataset

ds = load_dataset("UTAustin-AIHealth/MedHallu")

הרישיון

במטא-דאטה של העמוד נכתב שלא דווח רישיון, אך בטקסט עצמו של הכרטיס החוקרים ציינו במפורש רישיון MIT. רישיון MIT הוא רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים. עם זאת, בגלל חוסר ההתאמה בעמוד, כדאי לשמור עותק של הטקסט המצהיר על רישיון MIT למקרה של בדיקה משפטית.

הרישיון המלא ב־Hugging Face ↗