GPT
B

bart-large-cnn

קוד פתוח

facebookmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • rust

זהו מודל ותיק וממוקד שתפקידו הבלעדי הוא סיכום טקסטים באנגלית. הוא מתאים למי שרוצה לסכם פסקאות בלי להקים תשתית שלמה של מודלי ענק.

  • 406Mפרמטרים
  • 1,024טוקנים בהקשר
  • 8.0 GBמשקל הקבצים
  • 1,307,643הורדות בחודש

מה זה

מדובר בארכיטקטורת רצף לרצף שמשלבת מקודד דו כיווני ומפענח אוטורגרסיבי, עם 12 שכבות וכ־406 מיליון פרמטרים. פייסבוק אימנו אותו באמצעות פונקציית רעש שמשחיתה טקסט ולאחר מכן אימנו את המודל לשחזר את המקור. הגרסה הזו עברה כוונון ייעודי על מאגר CNN Daily Mail, שמכיל זוגות של כתבות חדשותיות והסיכומים שלהן, ולכן הוא מייצר סיכומים בסגנון עיתונאי ישיר.

בשונה ממודלים כלליים שלומדים הוראות מאפס, כאן המשימה מובנית מראש. אין צורך להנדס פרומפטים מורכבים עם דוגמאות. מכניסים טקסט ומקבלים סיכום. המודל שייך לתקופה שבה מודלים נבנו למשימה אחת בלבד, וזה היתרון שלו למי שמחפש פתרון קומפקטי שמפיק פסקאות תמציתיות על תוכן קיים בלי להמציא שיחה שלמה.

מתאים ל

  • סיכום כתבות באנגלית

    הוא אומן על מאגר חדשותי ולכן מייצר תקצירים קריאים ומהירים לידיעות ומאמרים.

  • עיבוד תמציות למיילים

    הגודל הקומפקטי מאפשר להפיק פסקת תקציר קצרה מתוך הודעות טקסט בלי שרתים כבדים.

  • צמצום תוצאות חיפוש

    מתאים לחיתוך פסקאות מתוך מסמכים באנגלית לכדי משפט מוביל ברור.

איפה זה נופל

הבעיה המרכזית היא חלון ההקשר. המודל מוגבל ל־1,024 טוקנים בלבד, מה שאומר שאי אפשר לזרוק עליו מסמכים ארוכים, דוחות כספיים או ספרים. בנוסף, הוא אומן על אנגלית בלבד ולא מתאים לעברית. אם תנסו לסכם איתו טקסט מקומי, התוצאה תהיה פגומה. מגבלה נוספת נובעת מנתוני האימון שלו, המודל למד מכתבות חדשות של CNN ו־Daily Mail, כך שהוא נוטה לסכם בסגנון חדשותי מובהק שלא תמיד יתאים לחומרים טכניים או משפטיים.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד. הרצה של טקסט בעברית לא תעבוד כראוי ותייצר פלט שגוי או מקוטע.

אפשר לסכם איתו מסמך של שלושים עמודים?

אי אפשר להזין מסמך שלם ישירות. חלון ההקשר מוגבל ל־1,024 טוקנים, ולכן צריך לחלק את המסמך לחלקים קטנים מראש, לסכם כל חלק בנפרד, או לחפש מודל עם חלון גדול יותר.

איך מריצים

המודל שוקל שמונה גיגה בייט בקבצים ונטען ישירות דרך ספריית transformers עם pipeline של סיכום. כיוון שיש לו 406 מיליון פרמטרים, אפשר להריץ אותו בקלות על מעבד גרפי יחיד עם זיכרון צנוע, ואפילו על מעבד רגיל של שרת אם זמן התגובה פחות קריטי לכם.

אם אתם צריכים לסכם כמויות קטנות של טקסט מדי פעם, לשלם לפי קריאה ל־API של ספק חיצוני עשוי להיות זול ופשוט יותר מתחזוקת שרת ייעודי. מריצים לבד רק כשיש נפח קבוע של עיבוד, או כשהטקסט רגיש ולא יכול לצאת מהתשתית המקומית שלכם.

from transformers import pipeline

pipe = pipeline("summarization", model="facebook/bart-large-cnn")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון פתוח ומתירני במיוחד, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗