GPT
M

medical-o1-reasoning-SFT

קוד פתוח

FreedomIntelligenceapache-2.02024-12-28

  • medical
  • biology

המאגר כולל שרשראות חשיבה רפואיות שנבנו לאימון מודלים סביב פתרון בעיות מורכבות. הוא מתאים למי שרוצה ללמד מודל לנמק צעדים קליניים ולא רק לפלוט אבחנה סופית.

  • 18,355הורדות בחודש
  • 1,177לייקים

מה זה

הנתונים נוצרו במקור כדי לאמן את HuatuoGPT-o1, מודל שמכוון לחשיבה רפואית עמוקה. הבסיס מורכב מבעיות רפואיות שניתן לאמת, שעבורן GPT-4o חיפש פתרונות ושרשראות הסקה. התוצרים עברו בדיקה ואימות באמצעות וריפייר ייעודי שבדק את תקינות הפתרון הרפואי.

המבנה הפנימי מחולק לכמה קובצי JSON לפי שפה והרכב המידע. ישנם קבצים שכוללים אך ורק שאלות ופתרונות רפואיים באנגלית ובסינית, לצד קבצי מיקס שמשלבים הוראות רפואיות יחד עם הנחיות כלליות. החלוקה הזו מאפשרת לבחור אם לאמן מודל ממוקד תחום או לשמר יכולות שיחה רחבות יותר במקביל.

מתאים ל

  • אימון מודל לחשיבה רפואית

    כוונון עדין של מודלי שפה כדי שייצרו שרשרת הנמקה מפורטת לפני הצגת תשובה רפואית.

  • אימון דו לשוני באנגלית וסינית

    התאמת מודלים רפואיים למענה בשפות אנגלית או סינית על בסיס קבצים מופרדים.

  • אימון משולב להוראות כלליות

    שימוש בקובצי המיקס כדי לשמר יכולת שיחה כללית לצד מומחיות קלינית.

איפה זה נופל

הנתונים נוצרו בעזרת GPT-4o ואומתו על ידי מודל שפה, כך שאין כאן בדיקה ידנית של רופאים אנושיים על כל רשומה. הדאטהסט קיים באנגלית ובסינית בלבד, ללא עברית כלל, ולכן אינו מתאים לאימון ישיר עבור השפה המקומית. בנוסף, מודל שמסתמך על דאטה סינתטי עלול לשכפל טעויות הסקה סמויות, מה שמחייב זהירות רבה לפני שמשלבים אותו במערכות קליניות אמיתיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוגדר הוא apache-2.0, ולכן מבחינה משפטית מותר להשתמש בו לצרכים מסחריים. עם זאת, הדאטהסט סונתז באמצעות GPT-4o, וצריך לקחת בחשבון את תנאי השימוש של יוצרי המודל המקורי לגבי אימון מודלים מתחרים. חברות רבות בודקות נקודה זו מול הייעוץ המשפטי שלהן לפני כניסה לפיתוח.

האם הדאטהסט כולל שאלות ותשובות בעברית?

לא, המאגר מוגדר לשפות אנגלית וסינית בלבד ואין בו נתונים בעברית. שימוש בו לפיתוח מודל בעברית ידרוש תרגום מורכב או אימון מקדים על שפה אחרת לפני התאמה מקומית. לא מומלץ להסתמך עליו כמקור יחיד למוצר שמיועד לשוק הישראלי.

איך נאספו ונוצרו שרשראות החשיבה בדאטהסט?

היוצרים אספו בעיות רפואיות שניתן לאמת את פתרונן, והשתמשו ב־GPT-4o כדי לחלץ את צעדי ההסקה. לאחר מכן, הפתרונות עברו סינון ואימות מול מודל וריפייר ייעודי שנועד לוודא שהתשובות נכונות. התהליך כולו מבוסס על יצירה וסינון ממוחשבים ולא על כתיבה ידנית של רופאים.

איך טוענים

טוענים את הקבצים ישירות דרך ספריית datasets או כקובצי JSON פשוטים מתוך המאגר. אין צורך בבקשת גישה מיוחדת או באישור ידני של היוצרים. כדאי לשים לב לשמות הקבצים בעת הטעינה, שכן קובץ כמו medical_o1_sft כולל תוכן רפואי בלבד, ואילו קובצי ה־mix מכילים גם דאטה כללי, מה שמשפיע ישירות על כמות הזיכרון וזמן האימון הדרוש.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של המידע ללא תשלום תמלוגים. אתם נדרשים לשמור על הקרדיט ליוצרים המקוריים ולצרף עותק של הרישיון. מודלים שאומנו על הדאטהסט הזה אינם מחויבים להיפתח בקוד פתוח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗