GPT
B

bigbird-pegasus-large-arxiv

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • bigbird_pegasus
  • text2text-generation
  • summarization

הוא מסכם מאמרים אקדמיים ארוכים באנגלית בלי לחתוך אותם בהתחלה. בזכות מנגנון קשב דליל, הוא מצליח לקרוא טקסטים של אלפי מילים בחצי מהמשאבים הרגילים.

  • 4,096טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 10,647הורדות בחודש
  • 65לייקים

מה זה

גוגל אימנה את המודל הזה ספציפית לתמצות של מאמרים מדעיים מתוך מאגר arxiv, על בסיס ארכיטקטורת BigBird Pegasus. הרעיון המרכזי פה הוא מנגנון block sparse attention, שפותר את צוואר הבקבוק הקלאסי של טרנספורמרים. במקום להשוות כל מילה לכל מילה אחרת במסמך, הוא דוגם את הקשרים בצורה חכמה ומאפשר לעבד קלטים ארוכים בהרבה בעלות חישובית נמוכה בהרבה מזו של מודלים כמו BERT.

התוצאה היא מודל שמסוגל להתמודד עם מבנה של מאמר מחקרי שלם, כולל מבוא, מתודולוגיה ודיון, ולהפיק ממנו תקציר קוהרנטי. בשונה ממודלים כלליים שכושלים ברגע שזורקים עליהם יותר מכמה פסקאות, כאן החיבור בין מנגנון הקשב הייעודי לבין אימון העומק על טקסטים אקדמיים נותן תמצות שמבין את הזרימה של כתיבה מדעית.

מתאים ל

  • תמצות מאמרים באנגלית

    הוא הותאם בדיוק למבנה של מאמרי מחקר ויודע לחלץ מהם את עיקרי הדברים בצורה תמציתית.

  • עיבוד מקדים למאגר מידע

    הוא מייצר תקצירים קצרים למסמכים ארוכים כדי להקל על חיפוש ואינדוקס מהיר.

  • סקירות ספרות אקדמיות

    הוא מאפשר לעבור על עשרות פרסומים טכניים ולסנן במהירות את אלה שרלוונטיים למחקר.

איפה זה נופל

הוא אומן אך ורק על מאמרים מדעיים באנגלית מתוך arxiv, כך שאם תנסו להריץ עליו עברית, תקבלו פלט שבור או חסר משמעות. מעבר לזה, הכתיבה שלו מוכוונת מאוד לז'רגון ומבנה אקדמי, ולכן הוא פחות יתאים לתמצות של חדשות, חוזים משפטיים או שיחות צ'אט. צוות הפיתוח המקורי של גוגל גם לא כתב כרטיס מודל מפורט, כך שאין תיעוד רשמי על הטיות מסוימות או חולשות ספציפיות שנתגלו באימון מעבר למה שחברי הקהילה של Hugging Face הוסיפו בעצמם.

שאלות
נפוצות

האם המודל הזה מסוגל לתמצת מסמכים בעברית?

לא. המודל אומן על טקסטים באנגלית בלבד מתוך מאגר המאמרים של arxiv. הזנת טקסט בעברית תניב תוצאות בלתי שמישות, ואם אתם צריכים תמצות בעברית תצטרכו לאמן אותו מחדש או לבחור מודל רב לשוני.

איזה סוגי טקסטים כדאי להריץ עליו?

הוא מצטיין במסמכים מדעיים וטכניים ארוכים שבנויים כמו מאמר מחקר. טקסטים קצרים מאוד, פוסטים מבלוגים או התכתבויות יומיומיות לא יפיקו ממנו את המיטב, כי הניסוח שלו מכויל לשפה אקדמית רשמית.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.2 ג'יגה בייט, כך שמדובר במודל קומפקטי יחסית שאפשר לטעון ולהריץ ישירות דרך ספריית transformers בתוך סביבת פייתון סטנדרטית. לצורך הסקה מהירה, כרטיס מסך בודד עם 8 עד 12 ג'יגה זיכרון יעשה את העבודה בלי בעיה, במיוחד אם אתם מעבדים מסמכים בזה אחר זה.

אם אתם לא מחזיקים שרת עם GPU זמין או שהתעבורה שלכם מוגבלת למסמכים בודדים ביום, עדיף לפנות לפתרונות אירוח מנוהלים. הרצה מקומית משתלמת רק כשרוצים לשמור את הטקסטים בתוך הרשת המקומית או לעבד כמויות גדולות של מאמרים בלי לשלם לפי קריאה.

from transformers import pipeline

pipe = pipeline("summarization", model="google/bigbird-pegasus-large-arxiv")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 הוא רישיון קוד פתוח מתירני מאוד. אתם רשאים להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו בתוך מוצר שאתם מוכרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗