GPT
B

bertweet-base-sentiment-analysis

קוד פתוח

finiteautomataרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • roberta
  • text-classification

הוא מנתח סנטימנט בציוצים באנגלית ומחזיר חיובי, שלילי או ניטרלי. אם המטרה היא לקרוא שפת רשת קצרה ומלוכלכת, הבסיס שלו נבנה בדיוק בשביל זה.

  • 130טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 550,249הורדות בחודש
  • 196לייקים

מה זה

מדובר במודל סיווג טקסט שמבוסס על ארכיטקטורת RoBERTa, אשר אומן מראש על מאגר ציוצים באנגלית ולאחר מכן עבר כוונון ייעודי על כארבעים אלף ציוצים מתוך SemEval 2017. הפלט שלו פשוט וכולל שלוש תוויות בלבד: חיובי, שלילי או ניטרלי. בשונה ממודלי שפה כלליים בגודל הזה שלעיתים נחנקים מול סלנג, איות משובש וקיצורים, הוא מגיע מהבית עם הבנה של שפת טוויטר.

המשקל שלו הוא סביב גיגה בייט בודד על פני שנים עשר שכבות, מה שהופך אותו לקל משקל ביחס למה שרץ כיום. אין כאן יומרה לייצר טקסט או לנהל שיחה, אלא לעשות עבודה אחת מוגדרת היטב על טקסטים קצרים באנגלית. מאחר שהוא חלק מפרויקט pysentimiento, הוא מכוון ישירות לפענוח רגשות וסנטימנט בשיח חברתי מבלי לדרוש כוונון נוסף מאפס.

מתאים ל

  • ניטור שיח בטוויטר

    הוא אומן על ציוצים אמיתיים ומזהה סלנג וקיצורים בלי להישבר.

  • סיווג תגובות קצרות

    חלון הטוקנים הקצר מתאים בדיוק לפידבקים קצרים באנגלית.

  • מחקר אקדמי ברשת

    הרישיון מאפשר שימוש לא מסחרי לניתוח מגמות ברשתות חברתיות.

איפה זה נופל

חלון ההקשר עומד על מאה ושלושים טוקנים בלבד. זה מספיק בהחלט לציוץ ממוצע, אבל פוסל אותו לגמרי מניתוח מאמרים, תגובות ארוכות או מסמכים. שנית, הוא מבין אך ורק אנגלית, כך שאין מה לחפש כאן תמיכה בעברית או בכל שפה אחרת. מעבר לזה, המודל אומן על קורפוס משנת 2017, מה שאומר שביטויים וסלנג חדשים שנולדו ברשת בשנים האחרונות עלולים להתפספס או לקבל סיווג שגוי.

שאלות
נפוצות

האם המודל יתמודד עם פסקאות או פוסטים ארוכים?

לא. חלון ההקשר שלו מוגבל למאה ושלושים טוקנים בלבד. טקסט ארוך ייחתך בדרך ויאבד את המשמעות שלו.

אפשר להשתמש בו במוצר מסחרי שפונה ללקוחות?

לא מומלץ בכלל. היוצרים ציינו שהספרייה מיועדת למחקר ולשימוש לא מסחרי, וגם המאגרים שעליהם אומן כפופים להגבלות דומות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון על גבי הארכיטקטורה הנתמכת, בלי סיבוכים מיותרים. קובצי המודל שוקלים גיגה בייט בודד בפורמט float32, כך שאין שום צורך בכרטיס מסך מפלצתי או בשרת ייעודי יקר כדי לקבל זמני תגובה טובים.

מעבד סטנדרטי במחשב פיתוח או שרת ענן פשוט יריצו אותו בלי להזיע. אם יש לכם שרת מקומי קטן או מכונה צנועה, עדיף בהרבה להריץ אותו ישירות אצלכם במקום לשלם על קריאות חוזרות לספקי API חיצוניים, במיוחד בהיקפי דאטה גדולים.

from transformers import pipeline

pipe = pipeline("text-classification", model="finiteautomata/bertweet-base-sentiment-analysis")
print(pipe("שלום"))

הרישיון

הרישיון בעמוד הרשמי מוגדר כלא דווח, אך בעלי המאגר מבהירים בספרייה שהשימוש מותר למחקר מדעי ולצרכים לא מסחריים בלבד. הדאטה ששימש לאימון כפוף לרישיונות צד שלישי, ולכן אסור לשלב אותו כחלק ממוצר מסחרי.

הרישיון המלא בעמוד המודל ↗