GPT
T

twitter-xlm-roberta-base-sentiment

קוד פתוח

cardiffnlpרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • xlm-roberta
  • text-classification

אימנו אותו על כמעט 200 מיליון ציוצים כדי לסווג סנטימנט בכמה שפות במקביל. הוא מזהה שפת רשת מחוספסת בהרבה שפות, בלי שתצטרכו לתרגם מראש לאנגלית.

  • 514טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 1,153,329הורדות בחודש
  • 275לייקים

מה זה

מדובר במודל XLM-RoBERTa בסיסי שעבר אימון מקדים על כ־198 מיליון ציוצים ולאחר מכן כוונון לסנטימנט בשמונה שפות שונות: ערבית, אנגלית, צרפתית, גרמנית, הינדי, איטלקית, ספרדית ופורטוגזית. המטרה שלו היא לתת מענה לטקסטים קצרים ורועשים מהרשת, שכוללים סלנג וקיצורים, מעבר לשפות המרכזיות הרגילות.

בניגוד למודלים כלליים שמתקשים עם שפת רשת וסלנג יומיומי, כאן הדאטהסט המקורי נלקח ישירות מטוויטר. הוא מחזיר שלוש תוויות בלבד: חיובי, ניטרלי ושלילי, יחד עם ציון ביטחון לכל תווית. זה הופך אותו ליעיל מאוד למיון מהיר של תגובות וציוצים מרובי שפות, אם כי הוא לא מיועד לניתוח טקסטים ארוכים או מאמרים רשמיים.

מתאים ל

  • ניטור תגובות רב לשוני

    הוא מזהה חיובי ושלילי בשמונה שפות בלי צורך לתרגם כל פוסט מראש.

  • סינון פידבקים ברשת

    אומן על שפת ציוצים ומבין קיצורים וסלנג טוב יותר ממודל ספרותי.

  • סיווג תמיכה טכנית

    מתאים למיון ראשוני ומהיר של הודעות קצרות ונזעמות של משתמשים.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים, כך שטקסטים ארוכים ייחתכו ולא יקבלו ניתוח מלא. מעבר לזה, הכוונון לסנטימנט נעשה רק על שמונה שפות ספציפיות, מה שאומר ששפות אחרות, כולל עברית, לא אומנו ישירות על המשימה הזו ועלולות להניב תוצאות לא מדויקות. סלנג מקומי שאינו חלק משמונה השפות האלו ייפול בקלות בין הכיסאות. חייבים לבדוק אותו על מדגם אמיתי של הדאטה שלכם לפני שמחברים אותו למוצר חי, במיוחד אם אתם מסתמכים עליו לזיהוי ציניות.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

הבסיס הוא רב לשוני, אבל הכוונון לסנטימנט נעשה על שמונה שפות ספציפיות שלא כוללות עברית. הוא עשוי לזהות משהו, אבל לא הייתי בונה עליו למוצר בעברית בלי בדיקה מעמיקה מראש.

איזה כרטיס מסך נדרש להרצה שלו בייצור?

המשקל שלו הוא 2.1 גיגה בייט בלבד. כל מעבד מודרני יכול להריץ אותו בקצב סביר, וכרטיס מסך בסיסי ביותר של 4 גיגה יספיק לעיבוד מהיר בכמויות גדולות.

איך מריצים

המודל שוקל 2.1 גיגה בייט ומבוסס על 12 שכבות, כך שהוא רץ בקלות על מעבד רגיל או כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון. מריצים אותו ישירות עם ספריית transformers של פייתון דרך פייפליין סטנדרטי של סנטימנט, או דרך ספריית tweetnlp שבה הוא שולב.

בגלל המשקל הנמוך, אין סיבה אמיתית לשלם על שירותי צד שלישי אם יש לכם שרת פשוט שכבר פעיל. הרצה עצמית תיתן לכם שליטה מלאה בפרטיות של הטקסטים בלי לשלם על כל קריאה.

from transformers import pipeline

pipe = pipeline("text-classification", model="cardiffnlp/twitter-xlm-roberta-base-sentiment")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. מצב כזה אומר שאין לכם היתר חוקי ברור להשתמש במשקלים במוצר מסחרי, וחובה לפנות אליהם או לבדוק במאגר הקוד הפתוח שלהם בגיטהאב לפני הפצה ללקוחות.

הרישיון המלא בעמוד המודל ↗