GPT
M

Medical-Reasoning-SFT-Mega

קוד פתוח

OpenMedapache-2.02026-02-06

  • medical
  • reasoning
  • healthcare
  • clinical
  • chain-of-thought

המאגר מרכז כמעט 1.8 מיליון שיחות רפואיות עם שרשראות חשיבה מפורטות. הוא מתאים למי שרוצה לאמן מודל להסביר את ההיגיון הקליני שלו במקום לפלוט תשובות קצרות.

  • 654הורדות בחודש
  • 100לייקים

מה זה

כל רשומה בנויה כשיחה בין משתמש לעוזר, שכוללת הנחיית מערכת, שאלה רפואית ותשובה. הייחוד נמצא בשדה reasoning_content שצמוד לתשובת העוזר ומציג את תהליך המחשבה של המודל לפני מתן המענה הסופי. כמעט כל הדוגמאות במאגר כוללות את שרשרת החשיבה הזו.

התוכן נאסף משבעה מודלים שונים, ביניהם GPT-OSS-120B, Qwen3-Next-80B ו־Trinity-Mini, מתוך כמעט שלושה מיליון רשומות מקוריות. כדי למנוע כפילויות, החוקרים שמרו שאלות ייחודיות כפי שהן, ואת השאלות שהופיעו אצל כמה מודלים חילקו באופן שווה יחסית בין המקורות במקום לתת למודל בודד להשתלט על המאגר.

מתאים ל

  • אימון SFT למודל רפואי

    לימוד מודלים כיצד לפרק שאלות בריאותיות מורכבות לשלבים לוגיים לפני ניסוח תשובה.

  • זיקוק ידע למודלים קטנים

    העברת יכולות הסקה ממודלי ענק לטובת מודלים מקומיים וזולים להרצה.

  • מחקר על דפוסי חשיבה מלאכותיים

    השוואת האופן שבו ארכיטקטורות שונות מנתחות אותה בעיה קלינית.

איפה זה נופל

כל התוכן סנטטי ומבוסס על פלטים של מודלי שפה, ללא בדיקה של רופאים בשר ודם. שרשראות החשיבה מייצגות דפוסי הסקה של מכונות ולא בהכרח פרוטוקול רפואי תקני, כך שעלולות ליפול שם שגיאות עובדתיות מסוכנות. המאגר קיים באנגלית בלבד, ואינו מתאים לאימון מערכות שמיועדות לקבל החלטות טיפוליות בעולם האמיתי.

שאלות
נפוצות

האם יש במאגר שאלות בעברית?

לא. כל הנתונים נאספו ונכתבו באנגלית בלבד. אם היעד הוא עבודה עם מערכת הבריאות בישראל, תצטרכו לתרגם את הנתונים או להשתמש במאגר נוסף.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא ללא תשלום תמלוגים. חובה רק לצרף את תנאי הרישיון המקוריים ואת הצהרת היוצרים של OpenMed.

האם התשובות וההסברים אומתו על ידי רופאים?

לא, מדובר בפלטים ישירים שנוצרו על ידי שבעה מודלי שפה שונים. הכרטיס מבהיר במפורש שהחומר אינו בדוק קלינית ועלול לכלול אי דיוקים חמורים.

איך נמנעו מכפילויות של אותן שאלות?

שאלות שהופיעו בכמה מודלים חולקו לפי מנגנון הקצאה הוגן. כל שאלה משותפת שובצה למודל שקיבל עד לאותו רגע הכי מעט שאלות כפולות, כדי לשמור על גיוון בסגנון התשובות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם השם OpenMed/Medical-Reasoning-SFT-Mega ללא צורך באישור גישה מראש. המידע מחולק ל־35 קובצי parquet תחת תיקיית data, כך שמומלץ לעבוד עם streaming אם הזיכרון מוגבל. המבנה מבוסס על מערך messages פשוט שקל להמיר לפורמטי אימון נפוצים.

from datasets import load_dataset

ds = load_dataset("OpenMed/Medical-Reasoning-SFT-Mega")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. משקלי מודל שאומנו על הנתונים אינם מחויבים להיפתח באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗