GPT
M

MedReason-Stenographic

קוד פתוח

openmed-communityapache-2.02026-01-09

  • medical
  • reasoning
  • chain-of-thought
  • stenographic-reasoning
  • synthetic

המאגר מציע מעל 31 אלף שאלות ותשובות רפואיות עם שרשראות חשיבה שנדחסו לסימנים גרפיים. הוא מיועד למי שמנסה ללמד מודלים להסיק מסקנות קליניות בלי לבזבז טוקנים על פטפוט.

  • 168הורדות בחודש
  • 56לייקים

מה זה

הנתונים מבוססים על MedReason המקורי וכוללים 31,535 זוגות של שאלה ותשובה באנגלית. המודל MiniMax M2.1 עיבד את המקור, ייצר עבור כל פריט הסבר מפורט באורך ממוצע של 5,548 תווים, ואז כיווץ אותו למחרוזת תמציתית של כ־384 תווים. הרשומות מגיעות מ־10,550 מזהי מקור ייחודיים, כך שיש שאלות שמנותחות בכמה וריאציות.

המבנה של כל רשומה כולל את השאלה, התשובה הסופית במבנה אחיד, שרשרת החשיבה המלאה, ושדה ההיגיון הדחוס. הדחיסה משתמשת בפרוטוקול שממיר שלבים קליניים לחצים, סימוני עובדות, הסקת מסקנות ואזהרות מפני טעויות, במקום שפה טבעית רגילה.

מתאים ל

  • אימון מודלים להסקה תמציתית

    לימוד מודלים להפיק נימוקים רפואיים דחוסים בפורמט סמלי כדי לחסוך זמן ריצה וטוקנים.

  • כיול שרשראות חשיבה ארוכות

    שימוש בשדה thinking כדי לאמן מודלים על תהליכי פתרון מפורטים של מבחנים רפואיים.

  • מחקר על דחיסת ידע סמלית

    בדיקת היכולת של רשתות נוירונים להבין חוקים לוגיים וסימנים מוסכמים במקום שפה טבעית.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מודל שפה, בלי בדיקה קלינית של רופאים אנושיים. יש פגמים טכניים שהיוצרים מודים בהם: 89 שאלות ריקות לחלוטין ו־9 תשובות חסרות. בנוסף, כל החומר כתוב באנגלית ואין בו שום התאמה למינוח או לפרקטיקה בישראל, כך שאי אפשר להסתמך עליו למערכת שמדברת עם משתמשים בלי סינון עמוק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא, כולל אימון מודלים סגורים. צריך רק לצרף את תנאי הרישיון המקוריים ולתת קרדיט ליוצרים.

האם יש כאן שאלות בעברית?

לא, כל המאגר כתוב באנגלית בלבד. אם המטרה היא לעבוד מול מערכת הבריאות בישראל, תצטרכו לתרגם את השאלות ולבדוק התאמה לפרוטוקולים המקומיים.

איך הנתונים האלה נוצרו בפועל?

החוקרים לקחו שאלות קיימות ממאגר MedReason והריצו עליהן את המודל MiniMax M2.1. המודל כתב הסבר ארוך, ולאחר מכן תרגם אותו לרצף של סימנים מוסכמים לפי פרוטוקול מוגדר מראש.

מה ההבדל בינו לבין MedReason המקורי?

המאגר המקורי הכיל הסברים בשפה חופשית. הגרסה הזו מוסיפה את תהליך החשיבה המלא של המודל וממירה את ההסברים לגרסה דחוסה של סימנים גרפיים במקום טקסט ארוך.

איך טוענים

טוענים את הדאטה ישירות דרך הספרייה של Hugging Face מקובץ parquet יחיד שנמצא בתיקיית data. אין צורך לבקש אישור גישה או לחכות למפתח, המאגר פתוח לחלוטין. השדות המרכזיים שצריך לשים לב אליהם באימון הם thinking שמכיל את תהליך החשיבה הגולמי, ו־reasoning שכולל את הגרסה הסמלית והמקוצרת לצד אפשרויות המענה.

from datasets import load_dataset

ds = load_dataset("openmed-community/MedReason-Stenographic")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון חופשי ומתיר שימוש מסחרי, שינוי של הנתונים ואימון מודלים פנימיים או חיצוניים בלי חובת שיתוף של התוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, לצד מתן ייחוס ליוצר המאגר ולמאגר המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗