GPT
D

distilbert-base-multilingual-cased-sentiments-student

קוד פתוח

lxyuanapache-2.02023-05-05

  • transformers
  • pytorch
  • onnx
  • safetensors
  • distilbert

זה מודל קל לסיווג רגש בשמונה שפות, שזוקק ממודל DeBERTa גדול כדי לעבוד מהר. הוא מתאים למי שצריך תיוג סנטימנט בסיסי בלי להחזיק שרת כבד.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 990,630הורדות בחודש

מה זה

מדובר בגרסת DistilBERT שזוקקה מתוך מודל מורה מסוג mDeBERTa-v3-base-mnli-xnli, על גבי נתונים של דאטה-סט רב לשוני לסנטימנט. תהליך הזיקוק לקח מודל אפס-צעדים כבד ויצק את היכולות שלו לתוך ארכיטקטורה צנועה של 135 מיליון פרמטרים. המטרה כאן היא לחסוך משאבים בייצור, תוך שמירה על יכולת סיווג סבירה בכמה שפות נפוצות כמו אנגלית, גרמנית, ספרדית, צרפתית, ערבית, יפנית, סינית ואינדונזית.

בכרטיס המודל אין מדדי דיוק או ציוני מבחן מספריים, כך שאי אפשר לדעת בדיוק כמה ביצועים הלכו לאיבוד בדרך מהמורה לתלמיד. היוצר מציין שהוא התעלם מהתיוגים המקוריים בדאטה כדי להדגים זיקוק מטקסט לא מתוייג. בפועל קיבלתם כלי ייעודי וזול לחישוב, אבל כזה שצריך לבדוק ידנית מול הנתונים שלכם לפני שסומכים עליו.

מתאים ל

  • ניתוח ביקורות באנגלית

    מיון מהיר של פידבקים קצרים מחנויות אפליקציות או אתרי מסחר, בלי להעמיס על השרת.

  • סינון הודעות תמיכה בערבית

    זיהוי לקוחות כועסים בפניות תמיכה בשפה הערבית לצורך תעדוף אוטומטי בתור.

  • סריקת תגובות ברשתות

    מעקב אחרי אזכורי מותג בפוסטים קצרים בכמה שפות אירופיות במקביל.

איפה זה נופל

הבעיה המרכזית עבור משתמשים בישראל היא היעדר עברית ברשימת השפות הנתמכות. המודל אומן על שמונה שפות ספציפיות, ועברית אינה אחת מהן, כך שהוא לא יעבוד על טקסט מקומי. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, מה שפוסל ניתוח של מסמכים שלמים או מאמרים ארוכים בלי לחתוך אותם קודם.

מעבר לכך, הכרטיס לא מציג שום מידע על חלוקת המחלקות, האם מדובר בחיובי ושלילי בלבד או גם ניטרלי, ואין נתוני איכות. מכיוון שהאימון בוצע בצורה עיוורת יחסית, המודל עלול לפספס אירוניה, סרקזם וביטויים מורכבים.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. רשימת השפות כוללת אנגלית, ערבית, גרמנית, ספרדית, צרפתית, יפנית, סינית ואינדונזית בלבד. טקסט בעברית יפיק כנראה שגיאות או תוצאות אקראיות חסרות משמעות.

איזה חומרה צריך כדי להריץ אותו בייצור?

מעבד מודרני רגיל עם 2 עד 4 גיגה זיכרון פנוי יספיק לרוב השימושים בקצב נמוך. אם יש עומס של מאות פניות בשנייה, מומלץ להעביר אותו לכרטיס מסך בסיסי.

איך מריצים

המודל שוקל 1.5 גיגה-בייט ורץ ישירות דרך ספריית transformers של פייתון. בגלל הגודל הקטן שלו אין שום צורך בכרטיס מסך מפלצתי, והוא ירוץ בלי בעיה גם על מעבד רגיל בשרת ענן פשוט, או על GPU בסיסי וזול אם יש לכם תעבורה גבוהה שדורשת עיבוד באצוות.

אם אתם צריכים לסווג כמה אלפי משפטים ביום, אין טעם לשלם ל־API חיצוני לפי קריאה. המודל מספיק קל כדי שתריצו אותו מקומית בתוך הקוד שלכם באפס עלויות תשתית מיוחדות. קריאה ל־API חיצוני עדיפה רק אם אתם לא רוצים לנהל שרתים בכלל או זקוקים לניתוח טקסטים ארוכים במיוחד.

from transformers import pipeline

pipe = pipeline("text-classification", model="lxyuan/distilbert-base-multilingual-cased-sentiments-student")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים בלי לחשוף את הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗