GPT
P

ncbi/pubmed

קוד פתוח

ncbiother2022-03-02

  • citation-estimation

המאגר מרכז מעל 36 מיליון רשומות ציטוט ותקצירים מעולם הרפואה ומדעי החיים באנגלית. זהו המקור הבסיסי והנרחב ביותר לאימון מודלים שצריכים להבין טקסט מדעי וביו-רפואי.

  • 2,283הורדות בחודש
  • 164לייקים

מה זה

הרשומות מבוססות על מאגר MEDLINE, כתבי עת במדעי החיים וספרים מקוונים. כל רשומה כוללת מטא-דאטה ביבליוגרפי כמו כותרת המאמר, רשימת מחברים, חומרים כימיים מקושרים, מספר מקורות, ובמקרים רבים גם את תקציר המחקר המלא. המידע אינו כולל את גוף המאמרים המלא, אלא רק את נתוני הציטוט והתקצירים.

המקור מופק מקובצי XML שנתיים של הספרייה הלאומית לרפואה בארצות הברית. כדי להתאים את המבנה ההיררכי והמורכב של קובצי המקור לפורמט שטוח ונוח יותר לעבודה, הושמט המידע על כתבי העת עצמם כדי למנוע שדות ריקים מרובים. אין כאן חלוקה מובנית לסט אימון, בדיקה או ולידציה, והנתונים מוגשים כיחידה אחת של עשרות מיליוני שורות.

מתאים ל

  • אימון מודלי שפה ביו-רפואיים

    לימוד מקדים של מודלי שפה על אוצר מילים ומבנים תחביריים מתוך עשרות מיליוני תקצירים מדעיים.

  • סיווג נושאי של מאמרים

    אימון מודלים למיון אוטומטי של מחקרים לפי כותרות, תקצירים ושיוך לחומרים כימיים שמופיעים ברשומה.

  • השלמת טקסט מדעי חסר

    משימות מיסוך והשלמת מונחים ברמת משפט או פסקה מתוך טקסטים רפואיים מורכבים.

איפה זה נופל

הנתונים כתובים באנגלית בלבד ואינם רלוונטיים למי שמחפש טקסטים רפואיים בעברית. יש פערים עקביים במידע עקב שינויי מדיניות לאורך השנים, שכן שדה התקציר נוצר רק בשנת 1975, ומאמרים מוקדמים יותר עשויים להכיל אותו רק אם נוספו למערכת מאוחר יותר. בנוסף, מאז 2016 מוציאים לאור מורשים לערוך נתוני ציטוט, מה שיוצר חוסר אחידות מול מדיניות האינדוקס המקורית.

שאלות
נפוצות

האם המאגר מכיל את גוף המאמרים המלא?

לא. המאגר מכיל נתוני ציטוט, כותרות ותקצירים בלבד. מי שמחפש את הטקסט המלא של המאמרים לא ימצא אותו כאן, אלא יצטרך לפנות למאגרים כמו פאבמד סנטרל.

האם מותר להשתמש בנתונים במוצר מסחרי?

הספרייה הלאומית לרפואה אינה גובה תשלום ומאפשרת גישה חופשית, אך מציינת במפורש שחלק מהתקצירים מוגנים בזכויות יוצרים של המוציאים לאור. בנוסף, חל איסור מוחלט להשתמש בשם המסחרי או לרמוז על תמיכת המוסד במוצר שלכם.

האם יש במאגר תוכן בעברית?

לא. הדאטהסט כולו מוגדר וקיים בשפה האנגלית בלבד, ואינו כולל תרגומים או מקורות בשפות אחרות.

איך מחולק הדאטהסט לאימון ובדיקה?

אין חלוקה מובנית לפיצולים של אימון, בדיקה או תיקוף. הנתונים מסופקים כמקשה אחת, ועליכם לבצע את החלוקה בעצמכם בהתאם לצורכי הפרויקט.

איך טוענים

המאגר נטען באמצעות ספריית הנתונים הרגילה של האגינג פייס לפי המזהה ncbi/pubmed, דרך סקריפט הטעינה המצורף. הגישה חופשית לגמרי ואינה דורשת הרשמה מוקדמת או אישור פרטני. השדות העיקריים לעבודה עם טקסט נמצאים תחת מבנה היררכי הכולל את כותרת המאמר והתקציר, לצד פרטי מחברים וכימיקלים. היקף הרשומות נע בין עשרה למאה מיליון, כך שטעינה מלאה לזיכרון דורשת משאבי אחסון ועיבוד מתאימים או עבודה בהזרמה.

from datasets import load_dataset

ds = load_dataset("ncbi/pubmed")

הרישיון

הרישיון מוגדר כאחר וכפוף לתנאי השימוש של הספרייה הלאומית לרפואה בארצות הברית. אין תשלום על השימוש במידע, אך נדרש מתן קרדיט ברור למקור. חל איסור מוחלט להשתמש בלוגו או בשם המסחרי לקידום מוצרים, או לטעון לתמיכה רשמית מצד המוסד. נקודה קריטית למוצרים מסחריים היא שחלק מהתקצירים עשויים להיות מוגנים בזכויות יוצרים של המוציאים לאור המקוריים.

הרישיון המלא ב־Hugging Face ↗