GPT
C

CMB

קוד פתוח

FreedomIntelligenceapache-2.02023-07-20

  • medical
  • biology
  • chemistry

המאגר מרכז מאות אלפי שאלות ומקרים קליניים להערכה ואימון של מודלי שפה ברפואה. הוא מיועד למי שבונה או בוחן מודלים שמיועדים לפעול בסינית.

  • 2,560הורדות בחודש
  • 38לייקים

מה זה

הנתונים מחולקים לשני חלקים עיקריים. החלק המרכזי נקרא CMB-Exam וכולל שאלות ממבחני רפואה בסין, המסווגות לשישה תחומים ראשיים ו־28 תתי תחומים. החלק הזה מכיל מעל 280,000 שאלות, מתוכן 269,359 מיועדות לאימון, 11,200 למבחן ו־280 לוולידציה עם הסברים מלאים. כל רשומה כוללת את סוג הבחינה, התחום, השאלה, אפשרויות הבחירה והתשובה הנכונה, בשאלות רב-ברירה או שאלות עם מספר תשובות נכונות.

החלק השני, CMB-Clin, מתמקד בהערכה קלינית מורכבת יותר. הוא כולל 74 מקרים רפואיים, שבהם כל מקרה מכיל את שם המחלה, תיאור מלא של המטופל וסדרה של שאלות ותשובות שנבנו על בסיס התיאור. רופאים אמיתיים השתתפו בהערכה האנושית של החלק הקליני הזה.

מתאים ל

  • בנצ׳מרק למודלים בסינית

    בדיקת יכולות ידע רפואי של מודלי שפה מול 11,200 שאלות מבחן בסינית.

  • אימון מודל רפואי ייעודי

    הזרקת ידע רפואי מקצועי באמצעות אימון על 269,359 שאלות ותשובות מקוריות.

  • בדיקת הסקת מסקנות קלינית

    הערכת תגובות מודל על 74 מקרי בוחן קליניים מורכבים הכוללים תיאורי מטופלים.

איפה זה נופל

כל החומר כתוב במנדרינית בלבד. אין כאן מילה אחת בעברית או באנגלית, ולכן אי אפשר להשתמש בו ישירות למערכות מקומיות בישראל בלי תרגום או התאמה תרבותית. בנוסף, מדובר במבחנים ופרוטוקולים שמשקפים את מערכת הבריאות והבחינות בסין, ולא סטנדרטים רפואיים של מדינות אחרות. החלק הקליני קטן מאוד ומכיל 74 מקרים בלבד, כך שהוא לא מספיק לאימון רחב אלא רק לבדיקה נקודתית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מסחריים. חובה רק לכלול את הודעת הרישיון והקרדיט ליוצרים.

האם יש במאגר שאלות בעברית או באנגלית?

לא. כל הנתונים, השאלות והתיאורים הקליניים מופיעים בסינית בלבד. למחקר בישראל הוא יעזור רק אם אתם עובדים על מודלים רב-לשוניים או מתרגמים את התוכן.

איך נאספו השאלות?

השאלות נלקחו מבחינות רפואיות רשמיות בסין ברמות שונות, כולל בחינות הסמכה לרופאים, וסווגו ל־28 תחומים. החלק הקליני נבנה מתיאורי מקרים מורכבים ונבדק על ידי רופאים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets ישירות מהמאגר, תוך בחירה בין תצורת exam לתצורת clin. אפשר גם להוריד את קובץ ה־ZIP מגיטהאב ולפתוח מקומית. אין צורך באישור גישה או ברישום מיוחד. הקבצים מגיעים בפורמט JSON, והשדות החשובים לניתוח הם השאלה, סוג הבחינה, האפשרויות, התשובה הנכונה, ובחלק הקליני שדה ה־QA_pairs.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/CMB")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במודלים אחרים, כולל מודלים קנייניים. התנאי העיקרי הוא מתן ייחוס למחברים המקוריים ושמירה על הודעות זכויות היוצרים והרישיון בקוד או בהפצה. אין חובה לשתף את המודל המאומן באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗