GPT
M

Multilingual-Medical-Corpus

קוד פתוח

HiTZapache-2.02024-03-26

  • medical

קורפוס של שלושה מיליארד מילים בטקסט רפואי בארבע שפות אירופיות. מתאים למי שרוצה לאמן מודלים שפתיים ייעודיים לרפואה בלי לאסוף מקורות מאפס.

  • 999הורדות בחודש
  • 45לייקים

מה זה

המאגר מיועד לאימון מודלים שפתיים בתחום הרפואי ומכיל טקסטים באנגלית, ספרדית, צרפתית ואיטלקית. הנתונים מחולקים לפי שפות, כאשר כל שפה נשענת על שילוב שונה לחלוטין של מקורות.

באנגלית החלק הארי מגיע מ־PubMed עם 968.4 מיליון מילים, לצד ClinicalTrials עם 127.4 מיליון מילים ו־EMEA עם 12 מיליון מילים. בספרדית המקור העיקרי הוא זחלן רפואי עם 918 מיליון מילים, יחד עם EMEA, PubMed, ויקיפדיה ומאגרי SPACC ו־UFAL. בצרפתית רוב הטקסט נשען על פטנטים מ־Google Patents שמספקים 654 מיליון מילים, בתוספת מאמרים מ־Science Direct, ויקיפדיה, PubMed ו־EDP. באיטלקית יש פיזור רחב של 13 מקורות, הבולט שבהם הוא Medical Commoncrawl עם 67 מיליון מילים, לצד עלוני תרופות, ערכי ויקיפדיה, תזות רפואיות, PubMed ורשומות קליניות.

מתאים ל

  • אימון מקדים למודלים רפואיים

    התאמת מודלי שפה קיימים לתחום הרפואה בארבע שפות אירופיות.

  • תיוג ישויות קליניות

    אימון מודלים למשימות זיהוי וסיווג מידע במסמכים רפואיים.

  • מחקר בלשני חישובי רפואי

    השוואת מינוח ודפוסי שפה רפואית בין אנגלית, ספרדית, צרפתית ואיטלקית.

איפה זה נופל

אין כאן עברית כלל, אלא רק אנגלית, ספרדית, צרפתית ואיטלקית. מעבר לכך, ההרכב התמטי משתנה באופן קיצוני בין שפה לשפה. בעוד שבאנגלית הבסיס הוא מחקרים אקדמיים וניסויים קליניים, בצרפתית החלק המכריע מגיע מרישומי פטנטים, ובאיטלקית הוא נשען על זחילת רשת וטקסטים מגוונים בהיקפים קטנים. ההבדלים האלה יוצרים פערי סגנון ואיכות בין השפות, והכרטיס לא מפרט תהליכי סינון, ניקוי רעשים או בדיקות תקינות שנערכו על הטקסטים.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. הקורפוס מכיל ארבע שפות בלבד: אנגלית, ספרדית, צרפתית ואיטלקית. למי שמחפש מידע רפואי בעברית, המאגר הזה לא יספק מענה.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על תנאי הייחוס ועותק הרישיון.

מה המקורות העיקריים של הטקסטים בדאטהסט?

המקורות משתנים לפי שפה. באנגלית המקור העיקרי הוא PubMed וניסויים קליניים, בצרפתית פטנטים, בספרדית זחילה ברשת, ובאיטלקית שילוב של זחילת רשת, עלוני תרופות וויקיפדיה.

האם אומנו כבר מודלים על בסיס הנתונים האלה?

כן. החוקרים אימנו בעזרתו את המודלים מסדרת Medical-mT5 בגדלים של 738 מיליון ו־3 מיליארד פרמטרים, המיועדים למודלי שפה ותיוג רצפים רב-משימתי.

איך טוענים

המאגר ציבורי ופתוח להורדה ישירה ללא צורך באישור גישה. הטקסטים שמורים ב־44 קבצי Parquet, המחולקים לפי שפות, כמו קבצי en ברצף של 16 חלקים. טוענים אותם באמצעות ספריית datasets של Hugging Face או ישירות בעזרת pandas ו־pyarrow. משקל הקבצים לא מצוין בכרטיס, אך מדובר בקורפוס של שלושה מיליארד מילים, כך שמומלץ להכין נפח אחסון פנוי ומשאבי זיכרון מתאימים לקריאה יעילה.

from datasets import load_dataset

ds = load_dataset("HiTZ/Multilingual-Medical-Corpus")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, מחקרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הדרישה העיקרית היא מתן קרדיט מתאים, שמירת הודעות זכויות היוצרים וצירוף עותק של הרישיון בכל הפצה של הקוד או הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗