GPT
M

Medical-Reasoning-SFT-Trinity-Mini

קוד פתוח

OpenMedapache-2.02026-01-30

  • medical
  • reasoning
  • healthcare
  • clinical
  • chain-of-thought

מאגר שנועד ללמד מודלים לנמק שלב אחרי שלב בעולם הרפואי. הוא מכיל מעל 810 אלף שיחות עם שרשראות חשיבה מפורטות שנוצרו במיוחד כדי לשפר תשובות לשאלות בריאות.

  • 240הורדות בחודש
  • 79לייקים

מה זה

המאגר כולל כ־810,374 רשומות המבוססות על שאלות ותשובות רפואיות. כל דוגמה בנויה כמערך הודעות בין משתמש לעוזר, כשהייחוד הוא שדה נפרד שמתעד את תהליך החשיבה של העוזר לפני מתן התשובה הסופית. בסך הכל יש כאן כ־1.52 מיליארד טוקנים, כאשר רובם, כ־977 מיליון, שייכים לחשיבה המקדימה ורק כ־542 מיליון לתשובות עצמן.

כל המידע סונתז באמצעות המודל arcee-ai/Trinity-Mini. הכרטיס לא מפרט מאיזה מקורות הגיעו שאלות המשתמש המקוריות או אם בוצע סינון ידני כלשהו על הפלטים, כך שמדובר בדאטה סינתטי מלא שנוצר על ידי מודל שפה יחיד.

מתאים ל

  • אימון SFT למודלים רפואיים

    לימוד מודל שפה לענות על שאלות רפואיות בצורה מובנית.

  • הטמעת שרשראות חשיבה

    אימון מודלים להציג את תהליך המחשבה לפני הפקת התשובה הסופית.

  • מחקר על הנמקה סינתטית

    בדיקת דפוסי הסקת מסקנות שנוצרו על ידי Trinity-Mini בתחום הבריאות.

איפה זה נופל

הנתונים כולם סינתטיים ונוצרו על ידי מודל בינה מלאכותית, כך שהם עלולים להכיל טעויות עובדתיות וחוסר דיוק קליני. הכרטיס מבהיר שתהליך החשיבה משקף את המודל שיצר אותו ולא בהכרח פרוטוקול רפואי תקין. בנוסף, המאגר קיים באנגלית בלבד, ואין בו שום מידע או התאמה למערכת הבריאות הישראלית או למונחים בעברית.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. כל הנתונים במאגר נוצרו באנגלית בלבד. אם אתם מכוונים למענה רפואי מקומי, תצטרכו לתרגם את החומר או לאמן על דאטה נפרד.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא apache-2.0 ולכן אין מניעה להשתמש בו באופן מסחרי. עליכם רק לשמור על תנאי הייחוס של הרישיון.

האם התשובות וההסברים נכתבו על ידי רופאים?

לא, הכל נוצר על ידי המודל arcee-ai/Trinity-Mini. אין במאגר אימות של אנשי מקצוע, ולכן אסור להסתמך עליו בהחלטות קליניות ללא בדיקה עצמאית.

איך המידע מאורגן בתוך הקבצים?

הנתונים יושבים ב־13 קובצי parquet תחת פיצול יחיד של train. כל רשומה כוללת שיחה עם שדות מוגדרים לתוכן ההודעה ולשרשרת החשיבה של העוזר.

איך טוענים

הטעינה מתבצעת ישירות בספריית datasets עם הנתיב OpenMed/Medical-Reasoning-SFT-Trinity-Mini, ללא צורך באישור גישה מוקדם. הנתונים מחולקים ל־13 קובצי parquet בפיצול train בלבד. המבנה מבוסס על שדה messages שמכיל role, content ו־reasoning_content, כך שניתן לסנן בקלות רשומות לפי קיום שרשרת החשיבה או להשתמש בהן ישירות לאימון SFT.

from datasets import load_dataset

ds = load_dataset("OpenMed/Medical-Reasoning-SFT-Trinity-Mini")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שיאומנו עליהם. התנאי העיקרי הוא מתן קרדיט וציון הרישיון המקורי, ללא דרישה לשתף תוצרים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗