GPT
T

twhin-bert-base

קוד פתוח

Twitterapache-2.02022-10-18

  • transformers
  • pytorch
  • safetensors
  • bert
  • fill-mask

יש כאן גם סקירה על Twitter עצמו.

מודל שפה רב לשוני מבית טוויטר שאומן על מיליארדי ציוצים יחד עם אותות חברתיים. הוא מיועד לניתוח טקסטים קצרים מרשתות ומשימות המלצה שבהן BERT רגיל מפספס את ההקשר החברתי.

  • 279Mפרמטרים
  • 512טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 37,004הורדות בחודש

מה זה

מדובר במודל מבוסס BERT בעל 12 שכבות שאומן על שבעה מיליארד ציוצים ביותר ממאה שפות שונות. השוני המרכזי שלו מדגמי שפה סטנדרטיים בגודל הזה טמון ביעד האימון. חוץ מהשלמת מילים מוסתרות, הוא שילב אופטימיזציה ישירה על גרף הקשרים והאינטראקציות של טוויטר.

השילוב הזה מאפשר לו לייצר ייצוגי טקסט שמבינים סלנג, קיצורים ומבנה של רשתות חברתיות טוב יותר ממודלים שאומנו על ויקיפדיה או ספרים. הוא נועד לשמש חלופה ישירה לכל מודל BERT קיים, במיוחד למשימות סיווג טקסט ולחיזוי מעורבות של משתמשים בפוסטים.

מתאים ל

  • סיווג ציוצים וסנטימנט

    הוא אומן על מיליארדי ציוצים ומבין שפת רשתות וסלנג טוב יותר ממודלי טקסט סטנדרטיים.

  • חיזוי מעורבות משתמשים

    אימון המודל כלל אותות חברתיים מתוך גרף הקשרים, מה שעוזר לדרג תוכן לפי פוטנציאל תגובה.

  • חילוץ וקטורים לטקסט קצר

    הוא מייצר ייצוג וקטורי ממוקד לפוסטים קצרים לצורך חיפוש והשוואת דמיון.

איפה זה נופל

חלון ההקשר שלו מוגבל ל־512 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים, מאמרים או סיכומי שיחות. הוא פותח סביב טקסטים קצרים מרשתות ולא מיועד ליצירת טקסט חופשי. נוסף לכך, רשימת השפות המרכזיות כוללת אנגלית, ערבית, יפנית ועוד, אך עברית אינה מופיעה ברשימה המפורטת, ולכן צריך לבדוק היטב את איכות הטוקניזציה והביצועים בעברית לפני שמשלבים אותו בפרויקט מקומי.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

המודל אומן על מעל מאה שפות, אך עברית אינה ברשימת השפות העיקריות שצוינו במפורש. מומלץ לבדוק את איכות הייצוג שלו על מדגם נתונים בעברית לפני שמחליטים להסתמך עליו במוצר.

האם אפשר להשתמש בו ליצירת טקסט ותשובות כמו צ'אט?

לא. מדובר בארכיטקטורת BERT שמיועדת להבנת טקסט, חילוץ וקטורים והשלמת מילים מוסתרות, ולא במודל יוצר כמו GPT.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות AutoModel ו־AutoTokenizer רגילים. הקבצים שוקלים 2.1 גיגה בייט בדיוק float32, כך שכל כרטיס מסך ביתי בסיסי עם 4 או 6 גיגה זיכרון יריץ אותו בקלות לחיזוי. אפשר להריץ אותו גם על מעבד רגיל בלי שום קושי אם זמן התגובה לא קריטי עד רמת האלפית שנייה.

קיימת גרסת base עם 279 מיליון פרמטרים וגרסת large עם 550 מיליון פרמטרים. אם המטרה היא להריץ משימות פשוטות של סיווג ציוצים או המלצות בזמן אמת, הגרסה הזו מספיקה לחלוטין ואין צורך לפנות ל־API חיצוני או לגרסה הגדולה יותר שצורכת משאבים כפולים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="Twitter/twhin-bert-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 הוא רישיון קוד פתוח מתירני מאוד. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗