GPT
P

pegasus-cnn_dailymail

קוד פתוח

googleרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • rust
  • pegasus
  • text2text-generation

פתרון ייעודי לתקצור מאמרים וכתבות באנגלית לפי הפורמט העיתונאי של CNN ו־Daily Mail. הוא נבנה מראש למשימה אחת בלבד וחוסך שימוש במודלי ענק כלליים.

  • 1,024טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 6,104הורדות בחודש
  • 113לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Pegasus עם 16 שכבות, שאומן ספציפית למשימת סיכום טקסטים. במקום ללמוד שיחה או כתיבת קוד, הוא אומן על מחיקת משפטים שלמים ושחזור שלהם מתוך קורפוסים כמו C4 ו־HugeNews, כשהגרסה הזו עברה כוונון ייעודי על מאגר הכתבות של CNN ו־Daily Mail.

התוצאות במבחן מול CNN ו־Daily Mail מציגות ציוני ROUGE של 44.16 על חפיפת מילים בודדות ו־41.30 על הרצף הארוך. המשמעות בפועל היא יכולת טובה לחלץ את הנקודות המרכזיות בכתבה ולנסח אותן מחדש כנקודות מפתח עיתונאיות, במקום להעתיק משפטים כמו שהם.

מתאים ל

  • סיכום כתבות וחדשות

    הוא עבר כוונון ייעודי על טקסטים עיתונאיים ומפיק פסקאות תמציתיות בפורמט חדשותי.

  • עיבוד תקצירי דואל

    מתאים לחילוץ הנקודות החשובות מהודעות ושרשורים קצרים שאינם חורגים מאלף טוקנים.

  • סקירת פוסטים ומאמרים

    מייצר תקצירים קריאים באנגלית מתוך מאמרי בלוג וטקסטים כלליים באורך בינוני.

איפה זה נופל

המגבלה הכי קריטית כאן היא חלון ההקשר, שעומד על 1,024 טוקנים בלבד. אי אפשר לזרוק אליו מסמכים ארוכים, ספרים או תמלילי פגישות, כי כל מה שמעבר לרף הזה ייחתך.

בנוסף, המודל אומן על אנגלית בלבד ומכוון מאוד לסגנון עיתונאי. אם תנסו להריץ עליו טקסטים בעברית, קוד, או מסמכים משפטיים מורכבים, התוצאה תהיה חסרת ערך.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל אומן והוגדר עבור השפה האנגלית בלבד. הרצה של טקסט בעברית לא תעבוד.

מה קורה אם הטקסט שלי ארוך מ־1,024 טוקנים?

הטקסט ייחתך והמודל יסכם רק את החלק הראשון שנכנס למגבלה. במקרה כזה תצטרכו לחלק את המאמר למקטעים בעצמכם או להשתמש במודל אחר עם חלון הקשר גדול יותר.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־5.0 גיגהבייט והוא רץ ישירות דרך ספריית transformers. תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגהבייט זיכרון כדי לטעון אותו ולבצע הסקת מסקנות במהירות סבירה, אם כי אפשר להריץ אותו גם על מעבד רגיל במחיר של זמני תגובה ארוכים.

אם יש לכם שרת עם כרטיס מסך מתאים והמטרה היא סיכום רציף באצווה, להריץ אותו לבד נותן לכם שליטה מלאה בפרטיות המידע. לעומת זאת, אם השימוש הוא אקראי בלבד או שהתשתית שלכם מוגבלת למעבדים חלשים, עדיף להשתמש בנקודת קצה מנוהלת דרך API.

from transformers import pipeline

pipe = pipeline("summarization", model="google/pegasus-cnn_dailymail")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. המצב הזה מציב סיכון משפטי ברור, כי ללא רישיון מפורש אין לכם היתר חוקי להפיץ אותו, להטמיע אותו במוצר מסחרי או להשתמש בו בסביבת ייצור בלי אישור נפרד.

הרישיון המלא בעמוד המודל ↗