GPT
P

pegasus-xsum

קוד פתוח

googleרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • pegasus

מודל ותיק של גוגל שמייצר תמציות חדות באנגלית ומכוון במיוחד למשפט סיכום בודד. הוא נבנה מראש לתמצות אבסטרקטי ולא לשיחה כללית.

  • 512טוקנים בהקשר
  • 8.5 GBמשקל הקבצים
  • 195,197הורדות בחודש
  • 222לייקים

מה זה

גוגל אימנו את הארכיטקטורה הזו במיוחד למשימת תמצות, בעזרת שיטה שמסתירה משפטים שלמים ודורשת מהרשת לייצר אותם מחדש. המשקל הספציפי הזה אומן על מאגר XSum, שכולל כתבות חדשותיות עם סיכום של משפט אחד בלבד. התוצאה היא מודל שלא מנסה לפתח שיחה אלא חותך ישר לעיקר ומייצר תקציר הדוק, כמעט כמו כותרת משנה עיתונאית.

בבדיקות מול מודלים קודמים שנבנו רק על מאגרי C4 או HugeNews, הגרסה המעודכנת הזו הגיעה לציון ROUGE של 47.60 ב־XSum, תוצאה גבוהה משמעותית מהאימונים המוקדמים. הטוקנייזר שלו יודע להתמודד עם שבירות שורה, והוא משתמש ב־16 שכבות כדי לזקק טקסט אנגלי ארוך יחסית לתוך משפט ממוקד.

מתאים ל

  • תקצור כתבות באנגלית

    מייצר משפט תמצית עיתונאי מתוך טקסטים קצרים שנכנסים במגבלת 512 הטוקנים.

  • יצירת כותרות משנה

    האימון על XSum הופך אותו למתאים במיוחד לכתיבת שורת סיכום מהירה מעל פסקאות תוכן.

  • תיוג תוכן פנימי

    מאפשר לייצר תיאור קצר לעמודי אינטרנט באנגלית כדי לעזור בחיפוש וקטלוג.

איפה זה נופל

המגבלה הכי קשה כאן היא חלון ההקשר. המודל מוגבל ל־512 טוקנים בלבד, שזה בערך עמוד טקסט קצר. אם תזרקו עליו מאמר אקדמי שלם, ספר או מסמך משפטי, הוא יחתוך את רוב התוכן ויתעלם ממנו לחלוטין. בנוסף, הוא תומך באנגלית בלבד ואינו מבין עברית, והאימון על XSum מכריח אותו לייצר תמצית קצרה מאוד, שלעיתים מחסירה פרטים קריטיים.

שאלות
נפוצות

האם המודל יודע לתמצת טקסטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד והוא אינו מותאם לשפות אחרות. אם תזינו לו עברית, הטוקנייזר ישבור את הטקסט לחלקים לא קריאים והפלט ייצא משובש.

אפשר להזין לו מסמך של עשרה עמודים?

לא בלי לחתוך אותו קודם. חלון ההקשר שלו מוגבל ל־512 טוקנים, ולכן הוא יקרא רק את הפסקאות הראשונות ויפספס את כל השאר. בשביל מסמכים ארוכים תצטרכו לפרק את הטקסט עצמאית.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון עם מחלקת PegasusForConditionalGeneration. הקבצים שוקלים 8.5 ג'יגה־בייט ונפרסים על פני 12 חלקים, כך שכדי להריץ אותו בהספק סביר תצטרכו כרטיס מסך עם לפחות 16 ג'יגה זיכרון וידאו, אחרת הטעינה לזיכרון תחנוק את השרת.

אם כל מה שאתם צריכים זה לתמצת מדי פעם כתבה בודדת, להרים שרת ייעודי בשביל קבצים בנפח כזה זה בזבוז משאבים. שווה להחזיק אותו עצמאית רק אם אתם מעבדים אלפי טקסטים באנגלית ברצף ולא רוצים להוציא את המידע החוצה לרשת.

from transformers import pipeline

pipe = pipeline("summarization", model="google/pegasus-xsum")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון רשמי בעמוד המודל. במצב כזה אין אישור משפטי מפורש לשימוש מסחרי, וארגונים שמקפידים על זכויות יוצרים וקוד פתוח ייקחו כאן סיכון אם ישלבו אותו במוצר חי בלי בדיקה מול גוגל.

הרישיון המלא בעמוד המודל ↗