GPT
M

mediflow

קוד פתוח

microsoftcdla-permissive-2.02025-05-27

  • clinical
  • medical

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מאגר נתונים סינתטי מקיף לעיבוד שפה קליני שמיועד להתאמת מודלי שפה למשימות רפואיות. הוא מספק דוגמאות מובנות לאימון מודלים קטנים ומבוסס על שילוב של הוראות, משימות מגוונות ותשובות מתויגות.

  • 411הורדות בחודש
  • 53לייקים

מה זה

המאגר מכיל 2.5 מיליון רשומות סינתטיות עם כ־700 אלף הוראות ייחודיות בתחום הקליני. הנתונים מתפרסים על פני 14 סוגי משימות שונים ו־98 סוגי מסמכים קליניים מפורטים, ומכילים שדות קלט, הוראות ביצוע ופלט צפוי בטקסט רגיל או בפורמט JSON.

התוכן מחולק לשני חלקים מרכזיים. החלק העיקרי כולל 2.5 מיליון דוגמאות שמיועדות לכוונון מונחה הוראות. החלק השני, mediflow_dpo, מכיל כ־135 אלף הוראות מובחרות הכוללות גם פלט שגוי שנוצר באמצעות GPT-4o לצד סוג השגיאה, לצורך אימון העדפה מסוג DPO. בנוסף, הרשומות כוללות ציוני איכות וריאליזם שנמדדו באמצעות מודל שפה, ודירוגי קושי המחולקים לשש רמות עם דגש על הרמות הגבוהות ביותר.

מתאים ל

  • אימון SFT למודל רפואי

    אימון מונחה הוראות של מודלי שפה קטנים לביצוע מטלות קליניות מגוונות והבנת מסמכים רפואיים.

  • יישור מודלים בשיטת DPO

    שימוש בחלק ה־DPO כדי ללמד מודל לזהות ולדחות טעויות רפואיות נפוצות ופלטים שגויים.

  • חילוץ מידע קליני ל־JSON

    התאמת מודלים להמרת טקסט רפואי חופשי ישירות למבני נתונים מסוג JSON לפי סוגי מסמכים שונים.

איפה זה נופל

מדובר בדאטהסט סינתטי לחלוטין שמבוסס כולו על אנגלית. אין בו נתונים בעברית, כך שהוא לא יעזור להתאמה לשפה המקומית ללא תרגום או עיבוד נוסף. כיוון שהמידע לא מגיע ישירות מתיקים רפואיים של חולים אמיתיים, קיים סיכון של חזרתיות והטיות של מודלי שפה. לא הייתי משתמש בזה למערכת שמקבלת החלטות טיפוליות בלי בדיקה מעמיקה של הפלטים מול רופאים, במיוחד כשמדובר במשימות רגישות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CDLA-Permissive-2.0 מאפשר שימוש מסחרי בנתונים. אתם יכולים לאמן עליהם מודלים למוצרים פנימיים או חיצוניים, בתנאי שאתם מספקים ייחוס בהתאם לתנאי הרישיון.

האם הדאטהסט כולל טקסטים בעברית?

לא, כל הנתונים במאגר מוגדרים ומיוצרים באנגלית בלבד. אם אתם מכוונים למערכת שמטפלת במסמכים רפואיים בעברית, תצטרכו לתרגם את הנתונים או לאמן מודל נפרד על מקורות מקומיים.

מאיפה הגיעו הנתונים והאם יש בהם סיכון לפרטיות?

הנתונים הם סינתטיים לחלוטין ונוצרו עבור משימות NLP שונות, כך שהם אינם כוללים מידע רפואי מזהה של מטופלים אמיתיים. פלטי השגיאה בחלק ה־DPO נוצרו באופן מכוון באמצעות GPT-4o כדי לאפשר תיקון של שגיאות קליניות.

איך טוענים

הנתונים מגיעים בקובצי JSONL המחולקים לשישה חלקים עבור מאגר הבסיס וחלק אחד עבור נתוני ה־DPO. המאגר פתוח להורדה ישירה ללא צורך באישור גישה או מילוי טפסים. לצורך טעינה וסינון, כדאי לשים לב לשדות task_type, difficulty_level ו־output_format כדי לחלץ את המשימות ורמות הקושי הרלוונטיות, וכן להשתמש בשדות rejected_output ו־error_type רק כאשר עובדים עם חלק ה־DPO.

from datasets import load_dataset

ds = load_dataset("microsoft/mediflow")

הרישיון

המאגר מופץ תחת רישיון CDLA-Permissive-2.0. הרישיון מאפשר שימוש חופשי בנתונים, כולל שימוש מסחרי והתאמה לצורכי המוצר שלכם, כל עוד שומרים על תנאי הייחוס של המאגר המקורי. הוא אינו כופה עליכם לשחרר את המודלים שאומנו עליו או נתונים נוספים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗