GPT
M

Medical-Reasoning-SFT-GPT-OSS-120B

קוד פתוח

OpenMedapache-2.02025-12-10

  • biology
  • medical
  • healthcare

מאגר שיחות רפואיות סינתטיות עם שרשראות חשיבה מפורטות באנגלית. הוא מיועד למי שרוצה לאמן מודל להסביר החלטות קליניות שלב אחר שלב במקום לפלוט תשובות קצרות.

  • 419הורדות בחודש
  • 254לייקים

מה זה

המאגר כולל 200,927 דוגמאות בפורמט שיחה סטנדרטי של משתמש ועוזר. המקור הבסיסי של השאלות מגיע ממאגר קיים בשם Intelligent-Internet/II-Medical-Reasoning-SFT, ועליו הורצו תשובות חדשות שנוצרו כולן באמצעות המודל gpt-oss-120B של OpenAI, כשההגדרה של מאמץ החשיבה כוונה לרמה גבוהה.

התשובות של העוזר ארוכות מאוד ומגיעות לממוצע של 2,569.2 טוקנים לדוגמה, בעוד ששאלות המשתמש קצרות יחסית עם ממוצע של 114.1 טוקנים. השיחות מתעדות תהליך חשיבה מובנה ומפורט שמסומן בתגיות ייעודיות לפני התשובה הסופית. התכנים מתפרסים על רפואה פנימית, כירורגיה, רפואת ילדים, גינקולוגיה, מדעי יסוד כמו פרמקולוגיה ופתולוגיה, אבחון מבדל, ושאלות במבנה של מבחני הסמכה רפואיים.

מתאים ל

  • אימון מודלים מנמקים

    כוונון עדין של מודלי שפה להפקת שרשראות חשיבה ארוכות ומנומקות בתרחישים קליניים מורכבים.

  • פתרון שאלות מבחני רפואה

    לימוד מודלים לפרק שאלות הסמכה רב-ברירתיות ולנמק את פסילת האבחנות השגויות.

  • זיקוק מודלים קטנים

    שימוש בתשובות המפורטות של המודל הגדול כדי להעביר יכולות ניתוח למודלים קומפקטיים יותר.

איפה זה נופל

מדובר בדאטה סינתטי לחלוטין שנוצר על ידי מודל שפה, ללא בדיקה של רופאים אנושיים שמאמתים את נכונות האבחנות או הטיפולים. אם המודל המקורי טעה או המציא עובדות ביולוגיות, הטעויות האלו נמצאות בתוך שרשרת החשיבה. הנתונים קיימים באנגלית בלבד, כך שהם לא מתאימים לאימון מודל קליני בעברית ללא תרגום והתאמה למונחים מקומיים. בנוסף, שאלות רבות עוסקות ברקע של מערכות בריאות זרות, כמו התייחסויות ספציפיות לצבא קנדה או לגופי בריאות אמריקאיים, מה שדורש סינון קפדני לפני שמשלבים את המידע במוצר מעשי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא. אתם יכולים לאמן מודלים לשימוש פנימי או למוצר שנמכר ללקוחות. התנאי העיקרי הוא מתן ייחוס ושמירה על קובץ הרישיון אם אתם מפיצים את הדאטהסט עצמו.

האם יש במאגר נתונים בעברית?

לא, כל הנתונים מוגדרים ומנוסחים באנגלית בלבד. כדי להשתמש ביכולות החשיבה שלו במערכת ישראלית תצטרכו לתרגם את השיחות או להסתמך על יכולות התרגום של המודל שתאמנו.

איך נוצר הדאטהסט בפועל?

היוצרים לקחו שאלות ומשימות ממאגר קיים של Intelligent-Internet והזינו אותן למודל gpt-oss-120B של OpenAI. המודל הופעל עם הגדרת חשיבה גבוהה כדי לייצר את תגיות המחשבה ואת התשובות המלאות.

מה ההבדל בינו לבין המאגר של Intelligent-Internet?

המאגר המקורי שימש כזרע בלבד לשאלות ולתרחישים. ההבדל המרכזי הוא התשובות עצמן, שנוצרו מחדש באמצעות מודל 120B עם דגש על שרשרת חשיבה מפורטת מאוד שמגיעה לאלפי טוקנים בכל רשומה.

איך טוענים

כל הנתונים מחולקים לחמישה קבצי Parquet בתוך תיקיית data, לצד קובץ התיעוד. הגישה למאגר פתוחה לחלוטין ללא צורך בהרשמה מוקדמת או באישור מיוחד. כדי לטעון אותו בקוד מספיק להשתמש בספריית datasets הרגילה של Hugging Face עם המזהה OpenMed/Medical-Reasoning-SFT-GPT-OSS-120B. המבנה מבוסס על מערך הודעות שבו לכל רשומה יש שדות של role ו־content, כך שהטקסט בתוך תגיות החשיבה של העוזר יושב ישירות בתוכן השיחה.

from datasets import load_dataset

ds = load_dataset("OpenMed/Medical-Reasoning-SFT-GPT-OSS-120B")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים, ושילוב שלהם במערכות סגורות או פתוחות. אין חובה לשתף מודלים שאימנתם תחת אותו הרישיון, אך יש לשמור על הצהרת זכויות היוצרים והודעת הרישיון המקורית של הפרויקט בכל הפצה של הנתונים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗