GPT
M

MedReason

קוד פתוח

UCSC-VLAAapache-2.02025-03-21

  • reasoning-datasets-competition
  • reasoning-LLMs

מאגר שמכיל שרשראות חשיבה רפואיות מובנות שנבנו בעזרת גרף ידע. מי שמאמן מודל למענה על שאלות קליניות ירצה אותו כדי ללמד את המודל לנמק צעד אחר צעד ולא רק לפלוט תשובה.

  • 986הורדות בחודש
  • 87לייקים

מה זה

המאגר כולל 32,682 זוגות של שאלות ותשובות רפואיות, כאשר לכל רשומה מוצמד הסבר מפורט שמציג שלבי חשיבה לוגיים. הרעיון כאן הוא לא להסתפק בתשובה נכונה, אלא להמיר את השאלה למסלול חשיבה קליני שמסביר איך מגיעים למסקנה.

הנתונים נאספו מתוך שבעה מאגרי שאלות ותשובות רפואיים קיימים. כדי לייצר את ההסברים, החוקרים נעזרו בגרף ידע רפואי מובנה שממנו נגזרו שרשראות ההיסק עבור כל שאלה, תהליך שנשען על עבודה קודמת של HuatuoGPT-o1 ונעזר בכלים כמו curator. הקובץ המרכזי ששותף נקרא ours_quality_33000.jsonl ומכיל את הדוגמאות המסוננות הללו.

מתאים ל

  • אימון מודלי חשיבה רפואיים

    כוונון עדין של מודלי שפה כדי שיידעו להציג שרשרת נימוק שלמה ולא רק תשובה סופית.

  • הערכת הנמקה קלינית

    בדיקת היכולת של מודלים קיימים להפיק צעדי היסק לוגיים מדויקים מול גרף ידע.

  • בניית סוכני הסבר רפואי

    יצירת ממשקים שמפרקים אבחנות רפואיות לשלבי ביניים מובנים עבור הצוות המטפל.

איפה זה נופל

הכרטיס לא מפרט אילו שפות נכללות, אך המאגרים הרפואיים המקובלים שמהם הוא נגזר הם באנגלית, כך שאין כאן התאמה לעברית או למינוח רפואי ישראלי. בנוסף, מדובר בהסברים שנוצרו באמצעות פייפליין ממוחשב שמבוסס על גרף ידע, ולכן קיימת אפשרות לשגיאות לוגיות ספציפיות שלא זוהו בסינון. לפני שמכניסים מודל כזה למערכת שמייעצת לאנשים, חובה לבצע בדיקה קלינית ידנית של הנימוקים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שדווח במאגר הוא apache-2.0, שמאפשר שימוש מסחרי מלא ללא תשלום. תצטרכו רק לכלול את הייחוס ליוצרים ואת עותק הרישיון המקורי בתוכנה או בהפצה שלכם. אין דרישה לפתוח את הקוד שלכם.

האם יש במאגר שאלות או תשובות בעברית?

המאגר מבוסס על שבעה מקורות נתונים רפואיים בינלאומיים שאינם כוללים עברית. הטקסט כולו באנגלית, ולכן לצורך עבודה בשפה העברית תצטרכו לתרגם את השאלות ואת מסלולי הנימוק בעצמכם. מומלץ לוודא שהתרגום שומר על המונחים הרפואיים המדויקים.

איך נוצרו נתיבי החשיבה שמופיעים בדאטהסט?

החוקרים שילבו שאלות משבעה מאגרי שאלות קיימים עם גרף ידע רפואי מובנה. על בסיס הגרף הזה הם יצרו פייפליין שהפיק שלבי חשיבה עובדתיים לכל שאלה. התוצאה הסופית עברה סינון איכות ונשמרה כקובץ jsonl.

איך טוענים

טוענים את הקובץ ישירות דרך ספריית datasets של Hugging Face באמצעות ציון הנתיב UCSC-VLAA/MedReason, או מורידים ישירות את הקובץ ours_quality_33000.jsonl מתוך המאגר. המאגר פתוח לציבור ואינו דורש הרשאת גישה מיוחדת, כך שאפשר להתחיל לעבוד איתו מיד בקריאת שורות json פשוטה כדי לחלץ את השאלות, התשובות ונתיבי ההסבר.

from datasets import load_dataset

ds = load_dataset("UCSC-VLAA/MedReason")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב אתכם לפתוח את הקוד שלכם או לשתף את המודל המאומן באותו רישיון. החובה העיקרית היא שמירה על הודעת זכויות היוצרים והייחוס ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗