GPT
L

long-t5-tglobal-base

קוד פתוח

googleapache-2.02022-04-16

  • transformers
  • pytorch
  • jax
  • longt5
  • text2text-generation

גרסה מורחבת של מודל T5 שמיועדת להתמודד עם רצפי טקסט ארוכים פי כמה מהרגיל. הוא פותר את צוואר הבקבוק החישובי שחוסם מודלים סטנדרטיים במסמכים מלאים.

  • 4,096טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 26,345הורדות בחודש
  • 49לייקים

מה זה

מדובר בארכיטקטורת encoder-decoder שמבוססת על T5 אבל משתמשת במנגנון שנקרא Transient-Global attention. במקום שכל טוקן יסתכל על כל טוקן אחר בטקסט, המודל משלב קשב מקומי עם שכבה שמייצגת את ההקשר הכללי, וכך הוא עוקף את בעיית הזיכרון הריבועית של טרנספורמרים רגילים.

המשקל שלו עומד על 1.8 גיגה בייט בדיוק של float32, שזה סדר גודל קומפקטי שמקביל למודלי base מוכרים. הוא עבר אימון מקדים בשיטת denoising שמזכירה את Pegasus, כך שהמטרה הטבעית שלו היא משימות שדורשות הפקת פלט מתוך קלט רחב, כמו סיכום טקסט או מענה לשאלות מתוך מסמכים ארוכים.

הייחוד כאן הוא היכולת לבלוע כמויות תוכן בלי לקרוס על חישובי זיכרון, אבל חשוב לזכור שהוא מגיע כמשקולת בסיס. הוא עדיין צריך כיוונון עדין על הנתונים שלכם כדי לתת תשובות שמתאימות למשימה ספציפית ולא רק לשחזר טקסט.

מתאים ל

  • סיכום מסמכים ארוכים באנגלית

    מנגנון הקשב המיוחד מאפשר לעבד רצפים ארוכים בלי פיצוץ זיכרון, מה שמתאים לדוחות ומאמרים.

  • מענה לשאלות מתוך טקסט

    הארכיטקטורה של encoder-decoder מתאימה לשליפת תשובות מתוך הקשר רחב שמכיל עמודים רבים.

  • בסיס לאימון משימות שפה

    נקודת פתיחה יעילה למי שבונה פתרון ייעודי ורוצה משקל קל עם יכולת קליטת קלט רחבה.

איפה זה נופל

הבעיה המרכזית היא שהמודל הזה לא מוכן לעבודה ישירות מהקופסה, אלא דורש אימון נוסף עם דאטה מתויג. בנוסף, הוא אומן אך ורק באנגלית, כך שאין מה לנסות להאכיל אותו בעברית. צוות המפתחים המקורי של גוגל אפילו לא כתב לו כרטיס מודל מסודר, מה שאומר שחסרים נתונים על הטיות, באגים ידועים ומגבלות בטיחות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקריאת מסמכים בעברית?

לא. המודל אומן רק על השפה האנגלית ולא יבין קלט בעברית. כדי לעבוד בעברית תצטרכו לחפש מודל שאומן על שפות מרובות או לאמן מודל כזה מאפס.

האם הוא יכול לענות לשאלות כמו צ'אטבוט ישר אחרי ההורדה?

לא, הוא מגיע רק עם אימון מקדים כללי ולא כוונן לשיחה או למענה על הוראות. כדי להפיק ממנו תועלת אמיתית חובה לבצע לו fine-tuning על מאגר נתונים ספציפי למשימה שלכם.

איך מריצים

כדי להריץ אותו צריך ספריית transformers רגילה של פייתון. הקבצים שוקלים 1.8 גיגה בייט, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יספיק לטעינה ולהסקה בלי בעיה, ואפשר אפילו להריץ אותו על מעבד רגיל אם לא לחוצים על זמני תגובה של אלפיות שניה.

מכיוון שהגרסה הזו היא מודל בסיס לא מכוונן, להריץ אותו ישירות בייצור ייתן מעט מאוד ערך. אם אתם לא מתכננים לאמן אותו על דאטה שלכם, עדיף לחפש גרסה שכבר עברה fine-tuning או לפנות לשירותי API חיצוניים שמציעים מודלים מכווננים למשימות סיכום.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/long-t5-tglobal-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, שזה רישיון קוד פתוח מתירני ונוח מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו כחלק ממוצר סגור או פתוח. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗