GPT
P

pubmed-summarization

קוד פתוח

ccdvרישיון לא דווח2022-03-02

  • conditional-text-generation

מאגר שמחבר מאמרים מדעיים מ־PubMed לתקצירים שלהם, ומיועד למשימות תמצות של טקסטים ארוכים. מי שבונה מודל להבנת ספרות רפואית ימצא כאן את החומר המלא לצד התקציר המקורי.

  • 6,328הורדות בחודש
  • 91לייקים

מה זה

הרשומות כאן מבוססות על מאמרים מדעיים ממאגר PubMed, והן נלקחו במקור מפרויקט חיצוני של תמצות מסמכים ארוכים. הטקסט המקורי עבר עיבוד מוקדם שחיבר חלקי מילים עם רווחים והוסיף ירידות שורה לפסקאות, כדי לשחזר מבנה קריא יחסית.

המבנה פשוט מאוד ומכיל שלושה שדות: מזהה המאמר, גוף המאמר המלא, והתקציר שמשמש כיעד לתמצות. הנתונים מחולקים כבר לשלושה חלקים מוכנים, כאשר רוב החומר נמצא בחלק האימון עם מעל 119 אלף רשומות, ועוד שני חלקים של בדיקה ואימות שכוללים מעט יותר מ־6,600 רשומות בכל אחד. בממוצע, גוף המאמר מכיל מעל שלושת אלפים טוקנים והתקציר קצת מעל מאתיים.

מתאים ל

  • אימון מודל תמצות ארוך

    לימוד מודלים איך לקחת מאמר רפואי שלם ולהפיק ממנו תקציר תמציתי ומדויק.

  • בדיקת ביצועים השוואתית

    הרצת חלק הבדיקה כדי להעריך איכות של מודלים קיימים מול תקצירי מאמרים מקוריים.

  • אימון מקדים לתחום הרפואה

    חשיפת ארכיטקטורות טקסט כלליות לאוצר מילים ולסגנון כתיבה מדעי באנגלית.

איפה זה נופל

כל הטקסטים כאן באנגלית בלבד וכוללים ז'רגון רפואי ומדעי כבד, כך שזה לא מתאים לעברית או לטקסטים כלליים. מאחר שהנתונים עברו טוקניזציה מוקדמת וחוברו מחדש עם רווחים וירידות שורה, עלולים לצוץ עיוותי פיסוק או בעיות בריווח. בנוסף, חלונות ההקשר של מודלים ישנים יתקשו עם אורך ממוצע של מעל שלושת אלפים מילים למאמר.

שאלות
נפוצות

מותר להשתמש בזה לפיתוח מוצר מסחרי?

לא מומלץ בכלל כרגע, כי לא צוין שום רישיון שימוש במאגר. שימוש כזה חושף אתכם לסיכונים משפטיים, במיוחד אם אתם מוכרים מודל שאומן על המידע הזה.

האם יש במאגר טקסטים בעברית?

לא. כל המאמרים והתקצירים מגיעים מ־PubMed והם באנגלית בלבד. אם המטרה היא תמצות בעברית, החומר הזה לא יעזור לכם בלי תרגום או התאמה נפרדת.

מה המשמעות של העיבוד המוקדם שהחומר עבר?

הטקסט המקורי חולק לטוקנים בעבר, ומי שהעלה את המאגר הזה פשוט חיבר אותם בחזרה עם רווחים והוסיף מעברי שורה. זה אומר שחלק מסימני הפיסוק או החיבורים בין מילים עשויים להיראות מעט משובשים ביחס למקור.

האם המאגר דורש משאבי מחשוב מיוחדים?

כן, בעיקר בגלל אורך הטקסטים. עם ממוצע של מעל שלושת אלפים טוקנים למאמר, תצטרכו מודל שתומך בחלון הקשר רחב ומספיק זיכרון כדי לעבד מסמכים מלאים.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face, כשהקבצים יושבים בפורמט Parquet בחלוקה למספר קבצים עבור האימון ושני קבצים בודדים לאימות ולבדיקה. אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה. אם עובדים עם סקריפטים סטנדרטיים של תמצות, צריך להגדיר ידנית את המיפוי כך שגוף הטקסט נלקח מהשדה article והתקציר מהשדה abstract.

from datasets import load_dataset

ds = load_dataset("ccdv/pubmed-summarization")

הרישיון

היוצרים לא דיווחו על רישיון בעמוד המאגר. מבחינה מעשית זה אומר שאין לכם שום אישור מפורש להשתמש בחומרים האלה, בטח שלא במוצר מסחרי. לפני שמאמנים מודל שמיועד להפצה או לעסק, כדאי לברר את מקור הזכויות של המאמרים המקוריים מול הפרויקט שפרסם אותם.

הרישיון המלא ב־Hugging Face ↗