GPT
I

II-Medical-Reasoning-SFT

קוד פתוח

Intelligent-Internetרישיון לא דווח2025-07-03

המאגר כולל 2,197,741 דוגמאות אימון לחשיבה רפואית, דיאלוגים מורכבים ותרחישים קליניים. הוא משלב שרשראות חשיבה מסוג R1, שאלות ממאגרים ידועים ודאטה סינתטי שנוצר ברובו במודלים מתקדמים.

  • 1,380הורדות בחודש
  • 57לייקים

מה זה

המאגר מאגד נתונים מכמה מקורות מרכזיים ומיועד לאימון מודלים על אבחון מבדל, קבלת החלטות ותכנון טיפול. חלק משמעותי מבוסס על 873,497 שאלות ותשובות שנוצרו באמצעות Qwen3-235B-A22B מתוך מאגרים כמו MedQA, MedMcQA ו־PubmedQA, כאשר המערכת דגמה מספר תשובות לכל שאלה ושמרה רק את הנכונה.

חלק מרכזי נוסף מורכב מ־1,025,903 דוגמאות של מעקב אחר הוראות רפואיות שנלקחו ממאגרים כמו ApolloCorpus ו־ChatDoctor. התשובות עברו שיפוט וסינון אוטומטי בעזרת GPT-4o, ורק פלטים שקיבלו ציון שמונה ומעלה מתוך עשר ביחס לתשובות מקור נשמרו.

בנוסף שולבו עקבות חשיבה שנאספו ממאגרי R1 ציבוריים. הנתונים האלו עברו קיבוץ לחמישים אלף אשכולות וסיווג באמצעות Qwen2.5-32b-Instruct כדי להשאיר אך ורק תכנים מתחומי הרפואה והביולוגיה. בסיום התהליך בוצע ניקוי כפילויות ומחיקת דליפות מול מאגרי הערכה ידועים.

מתאים ל

  • אימון SFT לחשיבה קלינית

    לימוד מודלים לפרק תהליכי אבחון מורכבים באמצעות שרשראות חשיבה רפואיות ייעודיות.

  • שיפור מענה להוראות רפואיות

    אימון מודל לתקשורת עם מטופלים על בסיס מיליון דוגמאות שעברו סינון איכות ב־GPT-4o.

  • זיקוק מודלי R1 לתחום הביולוגיה

    שימוש בעקבות החשיבה המסוננות לאימון מודלים קטנים על פתרון בעיות במדעי החיים.

איפה זה נופל

היוצרים מציינים במפורש שהמאגר עלול לכלול הטיות שמקורן בחומרי המקור, וידע רפואי מחייב עדכונים שוטפים שלא בהכרח משתקפים כאן. בעיה מהותית נוספת היא ההסתמכות הכבדה על מודלים שופטים ומייצרים כמו GPT-4o ו־Qwen3, מה שעלול לשמר הזיות ומבנה תשובות מלאכותי. בנוסף, רוב המאגרים המקוריים הם באנגלית עם חלק קטן בסינית, ללא כל התאמה לעברית או למערכת הבריאות המקומית בישראל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון של המאגר לא דווח כלל על ידי היוצרים. במצב הזה אין היתר שימוש מפורש, וכל שימוש מסחרי או שילוב במוצר הוא על אחריותכם בלבד ומייצר חשיפה משפטית.

האם הדאטהסט כולל שאלות ותשובות בעברית?

לא. החומרים נאספו ממאגרים בינלאומיים באנגלית ומאגר R1 בסינית, ללא מקורות מקומיים או תרגום לעברית. אם המטרה היא שימוש קליני מקומי, תצטרכו לאסוף או לתרגם נתונים בנפרד.

איך סוננו התשובות והאם המידע אמין?

הסינון התבסס על שילוב של השוואה לתשובות נכונות במאגרים קיימים ושיפוט אוטומטי של GPT-4o, שהשאיר רק פלטים שקיבלו ציון שמונה ומעלה. עם זאת, לא מדובר בבדיקה ידנית של רופאים על כל שני מיליון הרשומות, וייתכנו שגיאות שמקורן במודלים המייצרים.

האם הדאטהסט עלול לזהם בדיקות הערכה של המודל?

היוצרים ביצעו תהליך ניקוי ייעודי שמחק חפיפות מול מאגרי מבחן מקובלים באמצעות שיטות מבוססות 8-grams ואלגוריתם מתוך פרויקט s1k. למרות זאת, כדאי תמיד לבדוק חפיפות מול מערכי הבדיקה הפנימיים שלכם.

איך טוענים

הנתונים מפוצלים ל־41 קובצי parquet שונים בתוך תיקיית data, לצד קובץ התיעוד. אין צורך בבקשת גישה מיוחדת או באישור ידני כדי להוריד אותם.

בגלל היקף הנתונים שמגיע ליותר משני מיליון רשומות, מומלץ להוריד ישירות דרך ספריית datasets תוך הזרמה או טעינה מבוססת מקטעים. המאגר כולל פורמטים של דיאלוגים ושלבי חשיבה קליניים, ולכן חשוב למפות מראש את שדות השאילתה ושרשרת ההסבר לפני שמזינים אותם לתהליך האימון.

from datasets import load_dataset

ds = load_dataset("Intelligent-Internet/II-Medical-Reasoning-SFT")

הרישיון

היוצרים לא דיווחו על רישיון בעמוד המאגר. מבחינה מעשית זה אומר שזכויות השימוש אינן מוגדרות, ולא ברור אם מותר להשתמש במידע לפיתוח מסחרי או לפרסם מודל שאומן עליו. במצב כזה, שימוש בדאטהסט לפרויקטים מסחריים או ציבוריים כרוך בסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗