GPT
M

medical-o1-verifiable-problem

קוד פתוח

FreedomIntelligenceapache-2.02024-12-28

  • medical
  • biology

שאלות רפואיות פתוחות עם תשובות חד משמעיות לבדיקה שמבוססות על מבחני רפואה קשים. המטרה כאן היא לאמן מודלים על שרשראות חשיבה ואימות תשובה, ולא סתם לפלוט טקסט רפואי כללי.

  • 800הורדות בחודש
  • 124לייקים

מה זה

המאגר מכיל שאלות פתוחות בתחום הרפואה שלצדן מופיעה תשובת אמת ברורה. לפי המפתחים, הנתונים נלקחו מתוך בחינות רפואיות מאתגרות, מתוך כוונה לספק שאלות שדורשות היסק מורכב אבל עדיין מאפשרות בדיקה ואימות של תשובת המודל מול עובדה ברורה. הרעיון המרכזי בעבודה הזו, שמקושרת למחקר על HuatuoGPT-o1, הוא לחזק יכולות חשיבה רפואיות עמוקות.

בכרטיס המקורי אין פירוט מעבר לכך לגבי שלבי הסינון, החלוקה הפנימית למחלקות או שיטות העיבוד שנעשו על הבחינות. המידע הטכני היבש מצומצם מאוד וכולל בעיקר הפניה למאמר המלא ולמאגר הקוד הנלווה, כך שמי שרוצה להבין אילו מבחנים ספציפיים בפנים יצטרך לקרוא את המאמר עצמו.

מתאים ל

  • אימון מודלי חשיבה רפואיים

    כוונון עדין של מודלים ליצירת שרשראות היסק רפואיות עם תשובה סופית שניתנת לאימות.

  • הערכת ביצועים אוטומטית

    בנצ'מרק למודלי שפה על שאלות מבחן קשות מול תשובות אמת מוגדרות מראש.

  • אימון מבוסס תגמול ואימות

    בניית תהליכי RL שבהם המודל מקבל פידבק ישיר אם הגיע לתשובת האמת הרפואית הנכונה.

איפה זה נופל

הנתונים כולם באנגלית בלבד, בלי שום התאמה לשפות אחרות או למינוח הרפואי בעברית. בנוסף, מדובר בשאלות מבחן, כך שהן בודקות ידע תיאורטי מובנה ולא משקפות בהכרח שיח קליני אמיתי, תיעוד רפואי חי או מקרים מורכבים מהשטח. הכרטיס לא מפרט אילו הטיות קיימות בבחינות המקוריות, ולפני שלוקחים את זה למוצר מול משתמשים חייבים לבדוק עצמאית את דיוק התשובות והרלוונטיות שלהן להנחיות טיפול מקומיות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי ללא תשלום תמלוגים. חובת הייחוס קיימת, כלומר תצטרכו להשאיר את הודעות זכויות היוצרים של המפתחים.

האם המאגר כולל תוכן בעברית או תרגום?

לא, השפה היחידה המוגדרת במאגר היא אנגלית. כל השאלות ותשובות האמת מבוססות על מבחנים בשפה זו, ואם אתם צריכים עבודה בעברית תידרש עבודת תרגום והתאמה משמעותית.

מאיפה הגיעו הנתונים ואיך הם נאספו?

השאלות נלקחו מבחינות רפואיות מאתגרות, והותאמו כך שיהיו פתוחות אך עם תשובה שניתן לאמת בוודאות. כרטיס המאגר לא מפרט את שמות המבחנים עצמם, ומפנה למאמר המדעי של HuatuoGPT-o1 לקבלת מתודולוגיית האיסוף המלאה.

איך טוענים

הקובץ המרכזי יושב בפורמט JSON בשם medical_o1_verifiable_problem.json, לצד קובץ README ומטא-דאטה. אין צורך בבקשת גישה מיוחדת או באישור חוקרים, אפשר למשוך אותו ישירות דרך ספריית datasets הרגילה של Hugging Face. הוא מיועד למשימות של מענה על שאלות ויצירת טקסט, כאשר השדות החשובים לשימוש הם השאלה הפתוחה ותשובת האימות שמוגדרת מולה כעוגן.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/medical-o1-verifiable-problem")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המידע והפצה מחדש, ואינו מחייב אתכם לפתוח את הקוד שלכם או לשחרר נגזרות באותו הרישיון. תנאי הבסיס דורשים בעיקר מתן ייחוס למחברים, צירוף עותק מהרישיון וציון אם בוצעו שינויים בקבצים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗