GPT
B

bertweet-base

קוד פתוח

vinaimit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • roberta

אימנו אותו ספציפית על ציוצים באנגלית, כך שהוא מבין סלנג וקיצורים שדגמי שפה רגילים מפספסים. אם אתם מעבדים נתונים מטוויטר, הוא נקודת התחלה ממוקדת.

  • 130טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 213,912הורדות בחודש
  • 42לייקים

מה זה

במקום לאמן מודל על ויקיפדיה או ספרים, vinai לקחו ארכיטקטורת RoBERTa עם 12 שכבות ואימנו אותה מראש על 850 מיליון ציוצים באנגלית. מתוכם 845 מיליון נאספו בין השנים 2012 ל־2019, ועוד 5 מיליון ציוצים שקשורים למגפת הקורונה. בסך הכול מדובר על קורפוס של כ־16 מיליארד טוקנים.

בבסיסו הוא מוגדר למשימת השלמת מילים מוסתרות, אבל המטרה האמיתית היא להשתמש במשקלים שלו לכוונון עדין למשימות כמו זיהוי ישויות, ניתוח סנטימנט, תיוג חלקי דיבר וזיהוי אירוניה. בגלל הדאטה שעליו הוא גדל, הוא יודע להתמודד עם שפת רשת, מבנה לא תקני ואיות מרושל בצורה טובה בהרבה ממודל RoBERTa סטנדרטי.

מתאים ל

  • ניתוח סנטימנט בציוצים

    הוא אומן על שפת טוויטר ומבין קיצורים, סלנג ואירוניה באנגלית טוב יותר מדגמים כלליים.

  • חילוץ ישויות מרשתות

    מבנה RoBERTa שמותאם לטקסטים קצרים ורועשים עוזר לזהות שמות ומונחים בציוצים.

  • השלמת מילים בפוסטים

    ארכיטקטורת RobertaForMaskedLM המקורית מאפשרת לחזות טוקנים חסרים בטקסט חברתי קצר.

איפה זה נופל

חלון ההקשר שלו מוגבל ל־130 טוקנים בלבד. לטקסטים ארוכים, מאמרים או שרשורים הוא פשוט לא מתאים, אלא נבנה לציוץ בודד. בנוסף, כל הדאטה שלו מבוסס על ציוצים באנגלית עד שנת 2019 בתוספת ציוצי קורונה, כך שאין לו מושג בעברית, והוא לא מכיר אירועים, אישים או ביטויי רשת שנוצרו מאז.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

לא. המודל אומן אך ורק על ציוצים באנגלית. ניסיון להזין לו עברית ייתקל בטוקנייזר שלא מזהה את התווים ולא ייצר תוצאות שימושיות.

למה חלון ההקשר נעצר ב־130 טוקנים?

הוא נבנה במיוחד עבור טוויטר, שם אורך הטקסט מוגבל מטבעו. 130 טוקנים מכסים כמעט כל ציוץ בודד, אבל לא יאפשרו להזין מסמכים ארוכים.

איך מריצים

המודל שוקל 1.7 גיגה בייט בלבד ורץ דרך ספריית transformers, כך שאין שום צורך בכרטיסי מסך מפלצתיים. מעבד גרפי פשוט עם כמה גיגה בייט של זיכרון יספיק כדי לאמן אותו הלאה או להריץ הסקת מסקנות מקומית מהירה מאוד.

אפשר אפילו להריץ אותו על מעבד מרכזי רגיל אם הקצב שלכם נמוך. אין שום סיבה לשלם על API חיצוני לעיבוד טקסט כשמשקל כזה רץ בקלות על שרת מקומי בסיסי ביותר.

from transformers import pipeline

pipe = pipeline("fill-mask", model="vinai/bertweet-base")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗