GPT
M

multilingual-sentiment-analysis

קוד פתוח

tabularisaicc-by-nc-4.02024-12-07

  • transformers
  • safetensors
  • distilbert
  • text-classification
  • sentiment-analysis

פתרון קל משקל לניתוח סנטימנט בחמש רמות על פני 23 שפות. הוא שוקל חצי גיגה בלבד ומתאים למי שחייב סיווג רב לשוני מהיר בלי לתחזק מודלי ענק.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 520 MBמשקל הקבצים
  • 132,239הורדות בחודש

מה זה

מדובר בהתאמה של DistilBERT הרב לשוני למשימת סיווג טקסט לחמש רמות, החל משלילי מאוד ועד לחיובי מאוד. בניגוד למודלים שמסתפקים בחלוקה בינארית של חיובי מול שלילי, כאן מקבלים דירוג עדין יותר שמזהה גם דרגות קיצון וטקסט ניטרלי על פני עשרות שפות שונות, כולל ערבית, אנגלית, ספרדית ורוסית.

האימון נעשה כולו על גבי דאטה סינתטי שנוצר באמצעות מודלי שפה גדולים, לאורך 3.5 מחזורי אימון. המדד הבולט שהיוצרים מדווחים עליו בבדיקות הוא דיוק של כ־0.93 עם סטייה של עד דרגה אחת. המשמעות בפועל היא שהמודל כמעט אף פעם לא יבלבל בין חיובי מאוד לשלילי, אבל הוא בהחלט עשוי לתייג משפט חיובי קל בתור ניטרלי.

מתאים ל

  • ניטור רשתות בינלאומי

    מעקב אחרי אזכורי מותג ב־23 שפות במקביל, כדי לזהות זעם צרכני או גלי אהדה ללא תשתית שרתים יקרה.

  • סינון פידבקים ותמיכה

    מיון ראשוני של פניות לקוחות לפי דחיפות וטון הדיבור, ישירות לתורים של טיפול דחוף במקרים שליליים.

  • ניתוח ביקורות מוצר

    המרת טקסטים חופשיים של לקוחות גלובליים לדירוג של חמישה כוכבים לצורכי מחקר שוק והשוואה למתחרים.

איפה זה נופל

הבעיה המרכזית היא היעדר תמיכה בעברית. רשימת 23 השפות כוללת ערבית, רוסית ושפות אסייתיות, אך עברית נותרה בחוץ. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו או ידרשו פירוק מקדים.

מעבר לכך, כל נתוני האימון הם סינתטיים. היוצרים מודים בעצמם שחובה לבדוק את התוצאות מול דאטה אמיתי, שכן מודל שאומן על טקסט שנוצר בידי מכונה מתקשה לעיתים עם סלנג חי, שגיאות הקלדה וציניות של משתמשים ברשת.

שאלות
נפוצות

האם המודל יודע לנתח סנטימנט בעברית?

לא. המודל תומך ב־23 שפות רשמיות וביניהן אנגלית, ערבית, רוסית וספרדית, אבל עברית אינה חלק מהאימון. ניתוח טקסט עברי יניב תוצאות לא אמינות ולא מומלץ לנסות זאת.

האם אפשר להשתמש בו במוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שחוסם שימוש מסחרי מכל סוג. לשימוש מסחרי תצטרכו לפנות ישירות למפתחים בבקשה להסדר פרטי או לחפש מודל עם רישיון פתוח כמו אפאצ'י או MIT.

מה המשמעות של תוצאת הדיוק שפורסמה?

הציון 0.93 מתייחס לדיוק עם סטייה של עד דרגה אחת מתוך חמש. זה אומר שהמודל כמעט לא מחליף בין חיובי לשלילי, אבל עלול לטעות בין ניטרלי לחיובי קל, בייחוד בגלל שהאימון התבסס על מידע סינתטי.

איך מריצים

בזכות משקל של 520 מגה בייט ו־135 מיליון פרמטרים, המודל הזה רץ בקלות על כל מעבד מודרני ממוצע בשרת או במחשב מקומי, בלי שום חובה להחזיק כרטיס גרפי ייעודי. טוענים אותו ישירות דרך ספריית transformers בפייתון בארבע שורות קוד, והוא מגיב במהירות.

היוצרים מספקים דמו API חינמי לבדיקות מהירות מול השרתים שלהם דרך curl. אם אתם צריכים לסווג כמויות גדולות של טקסטים או לשמור על פרטיות המידע, אין סיבה להסתמך על השירות המרוחק, פשוט מורידים את המשקלים ומריצים עצמאית באפס מאמץ תשתיתי.

from transformers import pipeline

pipe = pipeline("text-classification", model="tabularisai/multilingual-sentiment-analysis")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 520 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון cc-by-nc-4.0. זה אומר שמותר להוריד, לשנות ולהשתמש בו למטרות מחקר, לימוד ובדיקות פנימיות, כל עוד נותנים קרדיט ליוצרים. השימוש המסחרי אסור לחלוטין. אם אתם בונים מוצר רווחי, שירות בתשלום או כלי פנימי לחברה עסקית, אי אפשר להשתמש במודל הזה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗