GPT
C

CareQA

קוד פתוח

HPAI-BSCapache-2.02024-04-18

  • medical
  • biology
  • nursing
  • pharmacology
  • chemistry

שאלות ממבחני ההסמכה הרפואיים הרשמיים בספרד בין 2020 ל־2024, בגרסה רב-ברירתית ובגרסה פתוחה. כלי בדיקה מצוין למי שרוצה לבחון ידע קליני ומדעי בספרדית או באנגלית.

  • 4,157הורדות בחודש
  • 17לייקים

מה זה

המאגר מבוסס על מבחני הכשרה רפואית מתקדמת של ממשלת ספרד (FSE) בחלוקה לביולוגיה, כימיה, רפואה, סיעוד, פרמקולוגיה ופסיכולוגיה. היוצרים שלפו את המבחנים מקובצי PDF, ניקו שאלות שכללו תרשימים או תמונות, והסירו שאלות שנפסלו רשמית בערעורים. כל רשומה כוללת מזהה ייחודי, שנת בחינה, קטגוריה ואת תוכן השאלה.

בגרסה הסגורה יש 5,621 שאלות אמריקאיות עם ארבע אפשרויות בחירה והפניה לתשובה הנכונה, הן בספרדית המקורית והן בתרגום אנגלי שבוצע עם GPT-4. הגרסה הפתוחה קיימת באנגלית בלבד ומכילה 2,769 שאלות שנוסחו מחדש באמצעות Qwen2.5-72B-Instruct כתשובה ישירה, לאחר סינון קפדני של שאלות דו-משמעיות ובדיקה אנושית מדגמית.

מתאים ל

  • בנצ'מרק למודלים רפואיים

    בדיקת דיוק והבנה מדעית של מודלי שפה באמצעות שאלות מבחן אמיתיות ברפואה ורוקחות.

  • הערכת מענה לשאלות פתוחות

    מדידת ביצועי מודל בייצור תשובה קלינית מנוסחת ישירות מול תשובת בוחן, באנגלית בלבד.

  • אימון ביצועים ממוקד בספרדית

    כוונון מודלים על טקסטים מקצועיים מתורגמים ופתורים מתוך עולם הרפואה והסיעוד.

איפה זה נופל

אם אתם בונים מוצר לשוק הישראלי, אין פה עברית בכלל, והבסיס המקורי משקף פרוטוקולים והסמכות של מערכת הבריאות הספרדית בלבד. הנתונים מתרכזים בחמש שנים בלבד ולא מייצגים את כלל הידע הרפואי הקיים. מעבר לכך, התרגום לאנגלית והניסוח הפתוח נשענים על מודלי שפה, ואף שהיוצרים ביצעו דגימה אנושית, עדיין עלולים להסתנן אי-דיוקים פנימיים או שגיאות פענוח מתוך ה־PDF המקוריים.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא, אין בו תוכן בעברית כלל. הנתונים קיימים אך ורק בספרדית מקורית או בתרגום לאנגלית. אם אתם זקוקים למבחנים בעברית תצטרכו לתרגם את המאגר עצמאית.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, כולל אימון מודלים סגורים ושילוב במוצרים, בתנאי שתשמרו על הודעת הקרדיט ליוצרים.

איך נאספו השאלות?

הנתונים נשלפו מקובצי PDF רשמיים של מבחני ההסמכה הספרדיים FSE בשנים 2020 עד 2024. הצוות הסיר ידנית שאלות עם שרטוטים, תמונות או פסילות רשמיות, ותרגם לאנגלית בעזרת מודלי שפה.

האם המאגר כולל חלוקה מובנית לטריין וטסט?

לא, כל הרשומות מוגדרות כסט הערכה (test) שלם. היוצרים בנו את המאגר כדי לבדוק מודלים ולא כדי לאמן אותם ישירות. אם אתם רוצים לאמן עליו, תצטרכו להפריד דוגמאות בעצמכם.

איך טוענים

אין צורך ברישום מוקדם או באישור גישה כדי להוריד את הקבצים. המידע מחולק לשלושה קובצי JSON ישירים: אחד בספרדית, אחד באנגלית לשאלות הסגורות, ואחד באנגלית לשאלות הפתוחות. כל המאגר נחשב כסט בדיקה (test set) ואינו כולל חלוקת אימון מובנית, כך שאם המטרה היא כוונון עדין תצטרכו לפצל אותו עצמאית. השדות המרכזיים לעיבוד הם question לצד cop ורשימת האפשרויות, או answer בגרסה הפתוחה.

from datasets import load_dataset

ds = load_dataset("HPAI-BSC/CareQA")

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי לחלוטין לצרכים מחקריים ומסחריים. מותר לאמן על הדאטהסט מודלים, לשנות את המבנה, לשלב אותו בצנרת פיתוח ולפרסם נגזרות בלי חובת שיתוף זהה, כל עוד שומרים על הודעת זכויות היוצרים והייחוס ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗