GPT
B

bigbird-roberta-base

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • big_bird
  • pretraining

גרסת בסיס שמביאה את רוברטה לקלטים ארוכים של עד 4,096 טוקנים. פתרון מדויק למי שחייב מודל קידוד לקטעי טקסט שלמים בלי לחתוך אותם ל־512.

  • 4,096טוקנים בהקשר
  • 978 MBמשקל הקבצים
  • 299,852הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל שמבוסס על מנגנון תשומת לב דלילה בחלוקה לבלוקים, מה שמאפשר לו לעבד טקסטים ארוכים בהרבה ממודלי BERT רגילים בלי לפוצץ את הזיכרון בריבוע. הוא אומן על משימת השלמת מילים מוסתרות באנגלית מתוך מאגרים כמו ספרים, חדשות, סיפורים וויקיפדיה, והוא התחיל ישירות ממשקולות קיימות של RoBERTa.

במקום לבזבז חישוב על קשר בין כל זוג מילים, הוא משתמש בחישוב מקומי ואקראי ששומר על יכולות הניתוח בעלות חישובית נמוכה. השיטה הזו מיועדת למשימות שמחייבות הקשר רחב ומלא, כמו מענה על שאלות מתוך מסמכים ארוכים או סיכום טקסט, בלי הצורך לפצל את המידע לחתיכות קטנות שמאבדות את הרצף.

מתאים ל

  • שאלות ותשובות ממסמכים

    הקשר של 4,096 טוקנים מאפשר לקרוא חוזים וטקסטים ארוכים באנגלית ולמצוא תשובות מדויקות.

  • חילוץ מאפיינים לטקסט ארוך

    הפקת וקטורים מייצגים מדוחות שלמים בלי לחתוך אותם לחלקים של 512 טוקנים.

  • בסיס למודל סיכום

    אימון נוסף למשימות תמצות של מאמרים ארוכים באנגלית בעזרת מנגנון הקשב הדליל.

איפה זה נופל

הוא אומן אך ורק באנגלית, כך שלעברית אין מה לנסות להשתמש בו ללא אימון מקיף מחדש. בנוסף, מדובר במודל בסיס שחזה מילים מוסתרות ולא עבר התאמה עדינה למשימה ספציפית, אז אי אפשר לזרוק עליו טקסט ולצפות לתשובות מוכנות בלי לאמן אותו קודם על הדאטה שלכם.

שאלות
נפוצות

האם אפשר להשתמש בו לעיבוד טקסטים בעברית?

לא. המודל אומן על קורפוסים באנגלית בלבד ומשתמש באוצר המילים של RoBERTa ו־GPT2. טקסט בעברית יתפרק לגורמים ולא יניב תוצאות שימושיות בלי אימון מאפס.

האם הוא מוכן לשימוש ישר מהקופסה?

לא ממש. הוא מודל Pre-trained של מילוי מסכות, כלומר הוא רק מבין את השפה ברקע. כדי לבצע משימה אמיתית כמו סיווג או חילוץ מידע תצטרכו להוסיף ראש מתאים ולאמן אותו על הנתונים שלכם.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם BigBirdModel. כברירת מחדל הוא רץ במצב הדליל עם בלוקים של 64 ושלושה בלוקים אקראיים, אבל אפשר להגדיר לו גם תשומת לב מלאה אם רוצים לבדוק התנהגות רגילה.

הקבצים שוקלים 978 מגהבייט בסך הכול, כך שכל מעבד גרפי פשוט ואפילו מעבד רגיל יריצו אותו בלי מאמץ מיוחד. אין שום סיבה לשלם לספק ענן או לפנות ל־API חיצוני בשביל גודל כזה, מחזיקים ומריצים אותו מקומית בקלות.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/bigbird-roberta-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 978 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מקנה חופש מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בקוד סגור, בלי דרישה לפתוח את הפיתוח שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗