GPT
R

ReasonMed

קוד פתוח

lingshu-medical-mllmapache-2.02025-06-10

  • biology
  • medical

המאגר מרכז 370 אלף שאלות רפואיות אמריקאיות עם שרשראות חשיבה מפורטות ומנומקות. הוא מיועד למי שרוצה לאמן מודלים על הסקת מסקנות קלינית ולא רק על ניחוש התשובה הנכונה.

  • 455הורדות בחודש
  • 94לייקים

מה זה

הנתונים מבוססים על 194,925 שאלות ברירה מרובה שנלקחו משישה מקורות מוכרים, בעיקר MedMCQA שמספק מעל 182 אלף שאלות, ולצידו MedQA, PubMedQA ותתי תחומים רפואיים מתוך MMLU.

במקום להסתמך על כותבים אנושיים, החוקרים ייצרו 1.75 מיליון נתיבי חשיבה באמצעות שלושה מודלים שונים: Qwen-2.5-72B, DeepSeek-R1-Distill-Llama-70B ו־HuatuoGPT-o1-70B. תהליך הסינון חילק את התוצאות לרמות קושי לפי כמות השגיאות שזיהה מודל שופט. מסלולים קלים דורגו ונבחרו, מסלולים בינוניים שוכתבו על ידי GPT-4o-mini, ושאלות קשות נבנו מחדש מאפס באמצעות GPT-o1.

התוצר הסופי מחולק לשלושה קבצים מרכזיים שמכילים 370 אלף דוגמאות כל אחד. קובץ CoTMed מחזיק רק את שרשרת החשיבה, ResponseMed כולל רק את התשובה והנימוק התמציתי, ו־ReasonMed משלב את שניהם בפורמט של תגיות think לפני התשובה הסופית.

מתאים ל

  • אימון מודלי הסקה רפואית

    כוונון עדין למודלי שפה כדי שייצרו שרשרת מחשבה מעמיקה ומנומקת לפני מתן תשובה לשאלה קלינית.

  • זיקוק תשובות קצרות

    שימוש בקובץ התשובות התמציתיות כדי ללמד מודלים רפואיים להסביר החלטות בקצרה ובבהירות.

  • בנצ'מרק ליכולות CoT

    בדיקה והשוואה של איכות ההנמקה של מודלים מול עשרות אלפי שאלות מבחן מוכרות ברפואה.

איפה זה נופל

כל שרשראות החשיבה כאן הן סינתטיות לחלוטין ונוצרו על ידי מודלי שפה, לא על ידי רופאים בשר ודם. למרות הסינון האוטומטי, מודלים עדיין נוטים להמציא עובדות שנשמעות משכנעות, ולכן אסור להסתמך על זה למערכות קליניות פעילות.

כל החומר באנגלית בלבד, ואין כאן מילה בעברית או התאמה לפרוטוקולים רפואיים ישראליים. בנוסף, מעל 90 אחוז מהשאלות מגיעות ממאגר יחיד, MedMCQA, מה שיוצר הטיה מובנית למבנה ולסגנון של הבחינות הללו.

שאלות
נפוצות

האם הדאטהסט כולל שאלות בעברית?

לא. כל הנתונים, השאלות ותהליכי החשיבה כתובים באנגלית בלבד ומבוססים על בנצ'מרקים אמריקאיים ובינלאומיים. כדי להשתמש בו בהקשר מקומי תצטרכו לתרגם ולהתאים את המידע למינוח הרפואי המקובל בארץ.

האם רופאים אמיתיים כתבו או בדקו את התשובות?

השאלות המקוריות מגיעות ממבחנים רפואיים קיימים, אבל שרשראות החשיבה וההסברים נוצרו על ידי מודלים כמו DeepSeek ו־Qwen וסוננו באמצעות מודלים של OpenAI. אין כאן תיקוף ידני של צוות רפואי אנושי על כל דוגמה.

באיזה קובץ כדאי להשתמש לאימון?

זה תלוי במבנה המודל שלכם. אם אתם מאמנים מודל הסקה שפולט קודם שלב חשיבה, השתמשו ב־ReasonMed.json שמכיל את תגיות החשיבה, ואם אתם צריכים רק את המסקנה הקלינית לכו על ResponseMed.json.

האם מותר להשתמש בזה למוצר מסחרי?

מבחינת הרישיון של המאגר, apache-2.0 מאפשר שימוש מסחרי חופשי למדי. הנקודה שדורשת זהירות היא שחלק מהטקסטים נוצרו או לוטשו באמצעות GPT-4o-mini ו־GPT-o1, מה שעלול להיות כפוף למגבלות השימוש המסחריות של OpenAI.

איך טוענים

המאגר פתוח לגישה ישירה ואינו דורש אישור מיוחד או הרשמה מוקדמת. כל המידע שמור בקובצי JSON פשוטים, כשהמרכזיים שבהם הם ReasonMed.json, CoTMed.json ו־ResponseMed.json.

בטעינה לקוד תעבדו בעיקר עם הטקסט של השאלה, שרשרת החשיבה והתשובה המזוקקת. אם אתם מאמנים מודלים בסגנון חשיבה מודרני, הקובץ המשולב ReasonMed סוגר את הפינה עם תגיות מובנות של תהליך ההסקה.

from datasets import load_dataset

ds = load_dataset("lingshu-medical-mllm/ReasonMed")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, מאחר שחלק מהנתונים סוננו ושוכתבו באמצעות מודלים של OpenAI, יש לוודא שהשימוש המסחרי שלכם אינו מתנגש עם תנאי השימוש של אותם שירותים חיצוניים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗