GPT
P

pegasus-large

קוד פתוח

googleרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • pegasus

מודל ייעודי לתמצות טקסטים באנגלית שפותח בגוגל. הוא בנוי לחלץ ולהשלים משפטים מרכזיים ומגיע מאומן על מאגרי חדשות ורשת גדולים.

  • 1,024טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 10,617הורדות בחודש
  • 107לייקים

מה זה

גוגל שחררו את המשקלים האלה כדי לתת מענה ממוקד למשימת תמצות טקסט. בניגוד למודלי שפה כלליים שמנסים לעשות הכל, הארכיטקטורה כאן אומנה ספציפית על מחיקת משפטים שלמים מתוך פסקאות ושחזור שלהם, שיטה שמתאימה ישירות להפקת תקצירים אבסטרקטיים.

הגרסה הזו עברה אימון משולב על C4 ועל HugeNews לאורך מיליון וחצי צעדים, עם דגימה אקראית של אחוזי המשפטים החסרים. מבחני ההשוואה בתיעוד מראים ציוני ROUGE גבוהים במיוחד על מאגרי חקיקה כמו billsum ותוכן חדשותי כמו xsum, שם השילוב של שני מאגרי המידע עוקף את האימונים הנפרדים. יחד עם זאת, במאגרים כמו reddit_tifu הציונים נשארים נמוכים משמעותית, סביב 27 נקודות, כך שסגנון כתיבה חופשי ולא פורמלי מניב תוצאות פחות טובות.

מתאים ל

  • תמצות מאמרי חדשות

    הוא הגיע לתוצאות גבוהות במיוחד על xsum ועל cnn_dailymail, ומספק פסקאות תמציתיות מדויקות לטקסט עיתונאי באנגלית.

  • עיבוד הצעות חוק ומסמכים

    במבחני billsum המודל קיבל את הציונים הגבוהים ביותר שלו, ומצטיין בחילוץ עיקרי דברים מניסוחים רשמיים ומובנים.

  • תקצור מדריכים טכניים

    הטוקנייזר המעודכן מזהה ירידות שורה ומאפשר לסכם הוראות שלב אחר שלב ממאגרים כמו wikihow בלי לאבד את מבנה הפסקאות.

איפה זה נופל

מגבלת הקלט היא 1,024 טוקנים בלבד. אי אפשר לזרוק עליו ספרים, דוחות ארוכים או תמלילי שיחות שלמים בלי לחתוך אותם מראש לחתיכות קטנות, מה שפוגע בהקשר הכללי. בנוסף, הוא תומך באנגלית בלבד. אין לו שום ידע בעברית, וניסיון להריץ עליו טקסט מקומי יחזיר פלט משובש לחלוטין. גם שינוי הטוקנייזר לתמיכה בירידות שורה עזר רק לחלק מסוגי התוכן, ובמאמרים אקדמיים ארוכים הביצועים שלו בינוניים.

שאלות
נפוצות

האם המודל מתאים לעבודה עם עברית?

לא. המודל אומן על אנגלית בלבד ומכיל אוצר מילים באנגלית. הוא לא יבין קלט בעברית ולא ייצר ממנו תקציר הגיוני.

איך אפשר לתמצת בעזרתו מסמך ארוך מעל 1,000 מילים?

בגלל חלון ההקשר של 1,024 טוקנים, תצטרכו לפצל את המסמך לפסקאות, לתמצת כל חלק בנפרד, ואז לאחד את התוצאות. זו עבודה ידנית שלא תמיד שומרת על חוט השדרה של המסמך.

איך מריצים

המודל שוקל 6.4 גיגה בייט ומחולק לעשרים ושלושה קבצים, כך שצריך כרטיס מסך עם זיכרון ייעודי סביר כדי להעלות אותו בלי לחנוק את המערכת. הוא רץ ישירות דרך ספריית transformers בפייתון באמצעות המחלקה PegasusForConditionalGeneration, ללא צורך בהתאמות מורכבות.

אם אתם צריכים רק לעבד כמה עשרות טקסטים ביום, החזקה של שרת פעיל עם חומרה כזו עשויה להיות בזבוז לעומת קריאה לשרת מנוהל חיצוני. מצד שני, אם יש לכם זרימת עבודה קבועה של סיכום מסמכים באנגלית ותרצו שליטה מלאה בנתונים בלי להוציא אותם החוצה, הרצה מקומית על מעבד גרפי עצמאי עושה עבודה מהירה.

from transformers import pipeline

pipe = pipeline("summarization", model="google/pegasus-large")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא מופיע רישיון שימוש, והשדה הושאר ריק. המשמעות פשוטה: אין לכם אישור משפטי מוגדר להשתמש בו במוצר מסחרי. לפני שמטמיעים אותו במערכת פעילה שמוכרת שירותים, צריך לבדוק את תנאי המאגר המקורי של גוגל מחקרית כדי לוודא שאין חשיפה לתביעות.

הרישיון המלא בעמוד המודל ↗