GPT
U

UltraMedical

קוד פתוח

TsinghuaC3Imit2024-04-26

אוסף של 410 אלף הוראות ביו רפואיות מסוננות שמתאימות לאימון מודלים בתחום הרפואה. החומר משלב שאלות ממבחנים ומאמרים יחד עם הרחבות סינתטיות שנוצרו ועובדו באמצעות מודלים של שפה.

  • 2,586הורדות בחודש
  • 32לייקים

מה זה

המאגר מאחד מקורות ידועים כמו MedQA, MedMCQA, PubMedQA ו־ChatDoctor, לצד דאטהסטים סינתטיים ייעודיים שנבנו עבור הפרויקט כמו MedQA-Evol ו־TextBookQA. הרשומות מחולקות לקטגוריות של מבחנים רפואיים, ספרות מחקרית ושאלות פתוחות, כשהמטרה היא לכסות מגוון רחב של רמות מורכבות.

הצוות ביצע סינון מבוסס מודל באמצעות gpt-3.5-turbo שהעניק ציון לכל הוראה, ורק חלק מהדגימות המקוריות נכנסו לאוסף הסופי. כל רשומה כוללת מזהה ייחודי שמשלב את שם המקור, שיחה עם שאלה ותשובה שנוצרו או הותאמו בעזרת GPT-4, תשובה מקורית, ואת ציון האיכות שניתן להוראה.

מתאים ל

  • אימון מודלי שיחה רפואיים

    כוונון עדין של מודלי שפה למתן מענה מורכב ומנומק על שאלות בנושאי רפואה ובריאות.

  • סימולציה של מבחני רפואה

    אימון והערכה של מודלים בפתרון שאלות מרובות ברירה מתוך בחינות הסמכה רפואיות.

  • תחקור ספרות מחקרית

    שיפור היכולת של מודל להתמודד עם שאלות המבוססות על תקצירי מחקרים מ־PubMed.

איפה זה נופל

כל הטקסט במאגר כתוב באנגלית בלבד, כך שהוא לא יעזור למי שבונה פתרון ייעודי לעברית ללא תרגום והתאמה. בנוסף, חלק עצום מהתשובות וההרחבות יוצר על ידי GPT-4 וסונן על ידי מודל שפה נוסף, מה שמכניס הטיות והזיות סינתטיות שאי אפשר לסמוך עליהן בעיוורון בעולם הרפואי. חובה לערוך ולידציה אנושית של מומחים לפני שמשתמשים בו במערכות קליניות אמיתיות.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, הנתונים כולם באנגלית בלבד. כדי להשתמש בהם בעברית תצטרכו לתרגם את השאלות והתשובות או להשתמש בהם לאימון מודל רב לשוני.

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון המדווח הוא MIT, שמתיר שימוש מסחרי ללא מגבלות מיוחדות מלבד מתן קרדיט. עם זאת, היות שחלק מהנתונים הופקו באמצעות מודלים של OpenAI, יש לבדוק אם תנאי השימוש שלהם חלים על המוצר שלכם.

איך בוצע הסינון של הנתונים?

החוקרים השתמשו במודל gpt-3.5-turbo כדי לתת ציון איכות לכל הוראה לפי מורכבות ומגוון. מתוך מאות אלפי שאלות מקוריות, רק אלו שקיבלו ציונים מתאימים נשמרו באוסף הסופי של 410 אלף הדגימות.

מה הופך אותו לשונה מדאטהסטים רפואיים אחרים?

במקום להתמקד במקור יחיד, הוא מאחד שאלות ממבחנים, מובאות ממאמרים ושיחות פתוחות, ומוסיף להן שאלות סינתטיות חדשות. בנוסף, כל התשובות עברו סטנדרטיזציה וניסוח מחדש באמצעות GPT-4.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באנגלית, ללא צורך בהרשאת גישה מיוחדת או אישור מקדים. הקבצים שמורים בפורמט parquet ומחולקים לשלושה חלקים עיקריים שמרכיבים יחד את קבוצת האימון. השדות המרכזיים שתרצו לבדוק בעיבוד הם conversation, שכולל את השאלות והתשובות מ־GPT-4, לצד שדות המזהה והציון.

from datasets import load_dataset

ds = load_dataset("TsinghuaC3I/UltraMedical")

הרישיון

המאגר מפורסם ברישיון MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון לא מגביל אימון של מודלים קנייניים, אך כדאי לקחת בחשבון שהתוכן נוצר בחלקו בעזרת שירותי חברת OpenAI.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗