GPT
L

longformer-base-4096

קוד פתוח

allenaiapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • longformer

פתרון מבוסס רוברטה שמתמודד עם טקסטים ארוכים פי שמונה מהרגיל. הוא מתאים למי שרוצה לעבד מסמכים שלמים בלי לקטוע אותם באמצע.

  • 4,098טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 1,004,931הורדות בחודש
  • 229לייקים

מה זה

מדובר במודל שמבוסס על משקלי RoBERTa ואומן מחדש על מסמכים ארוכים באמצעות משימת חיזוי מילים. בשונה ממודלים דומים שנחנקים אחרי חמש מאות ושנים עשר טוקנים, כאן אפשר להזין קלט שמגיע עד 4,096 טוקנים ברצף אחד.

ההבדל המשמעותי טמון במנגנון הקשב שלו. במקום לחשב קשר בין כל מילה לכל מילה בטקסט, שזה תהליך שדורש זיכרון עצום, הוא משלב חלון קשב מקומי שנע על הטקסט יחד עם קשב גלובלי מוגדר מראש. את הקשב הגלובלי אתם קובעים לפי המשימה, למשל סביב שאלות או כותרות.

מתאים ל

  • סיווג מסמכים משפטיים

    קריאת חוזים שלמים באנגלית והבנת ההקשר המלא בלי לפצל את הקובץ לחלקים קטנים.

  • מענה על שאלות ממאמרים

    שליפת תשובות מתוך דוחות ומאמרים מדעיים ארוכים על ידי הגדרת קשב גלובלי לשאלה.

  • חילוץ ישויות מטקסט רפואי

    זיהוי מונחים בתיקים רפואיים ארוכים באנגלית שחורגים מהמגבלה של מודלים רגילים.

איפה זה נופל

הוא מוגדר לשפה האנגלית בלבד, כך שלטקסטים בעברית הוא פשוט לא מתאים בלי אימון מאסיבי מאפס. בנוסף, הוא לא יעבוד טוב מחוץ לקופסה בלי שתגדירו נכון את הקשב הגלובלי בקוד, מה שדורש עבודת התאמה ידנית לכל משימה ספציפית.

שאלות
נפוצות

האם המודל מייצר טקסט חופשי כמו צ'אט?

לא. מדובר במודל ייצוג שנועד להבנה, סיווג, ושליפת מידע, ולא במודל שמייצר תשובות ארוכות או שיחות.

האם חייבים להגדיר קשב גלובלי כדי להריץ אותו?

אפשר להריץ אותו רק עם חלון הקשב המקומי, אבל הביצועים על משימות כמו מענה על שאלות ייפגעו מאוד בלי הגדרה נכונה של המילים שדורשות מבט רוחבי.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers של פייתון. הקבצים שוקלים שני גיגה בייט בלבד, כך שלא צריך מפלצת חומרה כדי להעלות אותו, וכרטיס מסך בסיסי או אפילו מעבד רגיל יספיקו לטעינה.

העניין מסתבך בזמן ריצה על רצפים מלאים של ארבעת אלפים טוקנים. שם צריכת הזיכרון עולה, ואם תרצו לבצע אימון נוסף או פיין טיונינג, תצטרכו כרטיס מסך ייעודי כדי שהתהליך לא יקרוס מחוסר זיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/longformer-base-4096")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 2.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אפאצ'י שתיים אפס מאפשר שימוש חופשי לגמרי, כולל שימוש במוצרים מסחריים סגורים. אתם יכולים לשנות את הקוד ולהפיץ אותו, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗