GPT
B

bigbird-pegasus-large-pubmed

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • bigbird_pegasus
  • text2text-generation
  • summarization

פתרון לתקצור מאמרים רפואיים ארוכים באנגלית בלי לחתוך את הטקסט באמצע. הוא מתמודד עם מסמכים שלמים בזכות מנגנון קשב דליל שחוסך משאבי חישוב.

  • 4,096טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 2,729הורדות בחודש
  • 46לייקים

מה זה

גוגל אימנו את המודל הזה ספציפית למשימת סיכום על גבי מאגר המאמרים המדעיים של PubMed. הוא בנוי על ארכיטקטורת BigBird Pegasus ומשתמש במנגנון שנקרא block sparse attention, שמאפשר לו לעבד קלט של עד 4,096 טוקנים. זה פי שמונה ממה שטרנספורמרים רגילים מסוגלים לבלוע בלי להיחנק על הזיכרון.

רוב המודלים בגודל הזה מוגבלים לטקסטים קצרים יחסית, מה שמאלץ מפתחים לפצל מסמך לחלקים ולסכם כל חלק בנפרד. כאן המבנה הדליל שומר על היכולת להבין הקשר כולל של מאמר רפואי מלא, בלי לשלם את המחיר החישובי הכבד של מנגנון קשב מלא.

מתאים ל

  • סיכום מאמרים בביו-רפואה

    הוא אומן על PubMed ויודע להוציא את עיקרי הדברים ממחקרים קליניים ומדעיים ארוכים באנגלית.

  • חילוץ תקצירים לספרות מחקרית

    חלון של 4,096 טוקנים מאפשר להזין מקטע מחקר שלם ולקבל תקציר קוהרנטי בלי לפצל את הטקסט.

  • מיפוי ניסויים קליניים

    מתאים לעיבוד דוחות ניסוי באנגלית כדי לייצר תמצית מנהלים מהירה לחוקרים.

איפה זה נופל

הוא אומן אך ורק באנגלית ורק על טקסטים ממאגר PubMed, כך שהוא לא מתאים לעברית וייכשל בניסיון לסכם תוכן כללי שאינו מדעי או רפואי. גוגל עצמם לא כתבו עבורו כרטיס מודל מלא, ולכן אין שום מידע רשמי על הטיות, אחוזי הזיות או מגבלות בטיחות. חובה לבדוק ידנית את הדיוק של הסיכומים לפני שמציגים אותם למשתמשי קצה, בייחוד כשמדובר במידע רפואי רגיש.

שאלות
נפוצות

האם אפשר להריץ אותו על טקסטים רפואיים בעברית?

לא. המודל תומך באנגלית בלבד ואומן על קורפוס אמריקאי. הזנת עברית תניב פלט משובש לחלוטין.

כמה כוח חישוב חוסך המנגנון של BigBird בפועל?

מנגנון הקשב הדליל מוריד את סיבוכיות החישוב מריבועית ללינארית ביחס לאורך הקלט. זה מאפשר לעבד 4,096 טוקנים בזיכרון של כרטיס מסך סטנדרטי בלי לקרוס.

איך מריצים

המודל שוקל 2.2 גיגה בייט ומגיע בתשעה קבצים שנטענים ישירות דרך ספריית transformers בפייתון. תצטרכו כרטיס מסך מודרני עם לפחות שמונה עד שנים עשר גיגה זיכרון כדי להריץ עליו הסקה באורך המקסימלי בלי לקבל שגיאות זיכרון, במיוחד בגלל מנגנון הפיענוח הארוך.

אם אתם צריכים לסכם מאמר בודד מדי פעם, עדיף להשתמש בפתרון ענן קיים במקום להחזיק שרת דלוק. הרצה עצמית שווה את המאמץ בעיקר אם יש לכם צנרת עיבוד מקומית של מסמכים רפואיים שחייבת לרוץ בקצב קבוע או מטעמי פרטיות נתונים.

from transformers import pipeline

pipe = pipeline("summarization", model="google/bigbird-pegasus-large-pubmed")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗