GPT
M

mT5_multilingual_XLSum

קוד פתוח

csebuetnlpרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • mt5
  • text2text-generation
  • summarization

מודל מכווץ של 2.2 גיגהבייט שמסכם טקסטים ב־45 שפות שונות. אם אתם צריכים תמצות רב־לשוני מקומי בלי להחזיק מודל נפרד לכל שפה, לכאן מסתכלים.

  • 2.2 GBמשקל הקבצים
  • 9,383הורדות בחודש
  • 329לייקים

מה זה

מדובר בגרסה מכוונת של mT5 על מאגר XL-Sum, שמיועדת למשימה אחת בלבד: יצירת תקצירים מטקסט ארוך. הוא אומן על עשרות שפות, ביניהן ערבית, אנגלית, צרפתית, סינית ופרסית, כשהייחוד שלו הוא הדחיסה של כל היכולת הזו לתוך חבילה אחת קטנה יחסית.

תוצאות ה־ROUGE מראות פערים חדים בין השפות. ביפנית הוא מגיע לציון ROUGE-2 של 23.8 ובערבית וסינית סביב 14 עד 17, שזה טווח שבו התקציר שומר על עקביות ומזהה את הרעיון המרכזי. לעומת זאת, בשפות כמו בורמזית, אוזבקית או אמהרית, ציוני ה־ROUGE-2 צונחים לאזור ה־5 עד 7, מה שאומר שבפועל הוא מחמיץ לחלוטין את מבנה המשפט ומייצר גיבוב מילים שלא מחזיק תוכן.

מתאים ל

  • תמצות חדשות רב־לשוני

    הוא אומן על כתבות ב־45 שפות ויודע לייצר פסקת תמצית מהירה בערבית, אנגלית וצרפתית.

  • עיבוד מסמכים אופליין

    משקל של 2.2 גיגהבייט מאפשר להריץ אותו מקומית על לפטופ בלי להוציא מידע רגיש החוצה.

  • סינון תוכן בשפות נדירות

    הוא נותן מענה בסיסי לשפות כמו אורדו ופשטו, שלא תמיד נתמכות היטב בכלים סטנדרטיים.

איפה זה נופל

עברית לא נמצאת ברשימת 45 השפות של המודל, כך שלטקסטים בעברית הוא פשוט לא שמיש. מעבר לזה, איכות התוצרים משתנה בצורה דרמטית בין שפה לשפה. בטקסטים באמהרית או בורמזית הוא יפספס עובדות וימציא משפטים, וגם בשפות החזקות יותר חובה לבדוק הזיות לפני שנותנים לתקציר להגיע למשתמש קצה.

שאלות
נפוצות

האם הוא מסוגל לתקצר טקסטים בעברית?

לא. עברית אינה נכללת ב־45 השפות שבהן המודל אומן, והרצה שלו על עברית תניב פלט משובש לחלוטין.

האם כדאי להכניס אותו כרגע למוצר מסחרי?

לא מומלץ. מעבר לכך שצריך לבדוק איכות בכל שפה בנפרד, העובדה שלא שוחרר רישיון רשמי מונעת שימוש מסחרי בטוח.

איך מריצים

המשקל הכולל יושב על 2.2 גיגהבייט, כך שאפשר לטעון אותו ישירות דרך ספריית transformers גם על כרטיס מסך ביתי צנוע עם 6 עד 8 גיגהבייט זיכרון, או אפילו על מעבד סביר אם לא בונים על זמני תגובה של שבריר שנייה. הוא לא דורש שרתים מנופחים.

אם כל מה שמעניין אתכם זה אנגלית או ערבית בנפחים נמוכים, קריאה ישירה למודל קנייני מרוחק תעשה עבודה חלקה יותר ותחסוך תחזוקת תשתית. שווה להרים אותו עצמאית בעיקר אם רוצים פרטיות מלאה של הטקסט, חסינות מניתוקי רשת, או כשחייבים לעבד רשימת שפות אקזוטית במקום אחד בלי לשלם לפי טוקן.

from transformers import pipeline

pipe = pipeline("summarization", model="csebuetnlp/mT5_multilingual_XLSum")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון משמעו שאין אישור מפורש לשימוש מסחרי או להפצה בתוך מוצר, וכל שימוש כזה חושף אתכם לתביעה עד שהיוצרים יבהירו את הסטטוס.

הרישיון המלא בעמוד המודל ↗