GPT
B

bert-base-turkish-sentiment-cased

קוד פתוח

savasyרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • bert

מודל סיווג קלאסי וקל לניתוח סנטימנט בטורקית. הוא מתאים אם יש לכם טקסטים קצרים בשפה הזו ואתם מחפשים פתרון ממוקד בלי להחזיק מודלי ענק.

  • 111Mפרמטרים
  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 62,350הורדות בחודש

מה זה

מדובר בהתאמה של BERTurk למשימת ניתוח סנטימנט בינארי בטורקית. עם 111 מיליון פרמטרים ומשקל קבצים של 1.3 גיגה בייט, הוא מייצג את הגישה הישנה והמוכחת של עיבוד שפה טבעית, בלי גנרציה ובלי התחכמויות. אתם שולחים משפט ומקבלים תווית חיובית או שלילית.

האימון שלו נשען על קצת יותר מ־48 אלף דוגמאות שחוברו יחד, הכוללות ציוצים וביקורות של משתמשים על מוצרים וסרטים מאתרים טורקיים. המפרסם מציג דיוק הערכה של כ־95.4 אחוז במערך הבדיקה. בפועל זה אומר שעל טקסטים דומים של סקירות מוצרים או תגובות קצרות הוא יזהה את הכיוון הכללי באמינות טובה, אבל המספר הזה נמדד על נתונים נקיים יחסית ומפולטים, שבהם דירוגים בינוניים פשוט נמחקו.

מתאים ל

  • סיווג ביקורות מוצר

    סינון מהיר של תגובות גולשים על מוצרים בטורקית כדי להפריד בין לקוחות מרוצים לכאלה שחוו תקלה.

  • ניטור שיח ברשתות

    מעקב אחרי אזכורי מותג בפוסטים וציוצים קצרים בטורקית וחלוקה גסה לחיובי ושלילי.

  • סינון ראשוני למוקדי שירות

    הפניה אוטומטית של פניות זועמות בטורקית לתור טיפול דחוף על בסיס זיהוי סנטימנט שלילי מובהק.

איפה זה נופל

האימון התבצע עם אורך רצף של 128 טוקנים בלבד, למרות המגבלה התיאורטית של 512. טקסטים ארוכים, פסקאות מורכבות או מאמרים ייחתכו או יאבדו מהר מאוד את ההקשר. בנוסף, הדאטה־סט המקורי סינן מראש ציונים בינוניים והגדיר חיובי מעל 4 ושלילי מתחת ל־2, כך שהמודל מחזיר רק תוויות בינאריות ולא מבין מה זו תגובה ניטרלית או מעורבת. אם המשתמש שלכם כותב משהו מורכב, המודל ייאלץ לבחור צד בכוח.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל עבר אימון על בסיס טורקי ייעודי והנתונים שלו כוללים אך ורק טקסטים בטורקית. אם תזינו לו עברית, הוא פשוט יפלוט ניחוש חסר משמעות.

איך מחזירים ממנו טקסט ולא רק תווית סנטימנט?

אי אפשר. זהו מודל סיווג טהור המבוסס על BertForSequenceClassification. הוא לא מודל שפה גנרטיבי, אין לו יכולת לשוחח או לנסח תשובות, והוא מסוגל להחזיר רק הסתברות בין שתי תוויות קבועות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות צינור sentiment-analysis פשוט. המשקל הכולל יושב סביב 1.3 גיגה בייט, כך שכל כרטיס מסך בסיסי או אפילו שרת עם מעבד רגיל יריצו אותו בלי מאמץ ובלי צורך בתשתיות ייעודיות.

אין כאן כמה גרסאות לבחור ביניהן. אם אתם צריכים לסווג אלפי משפטים בודדים ברקע, אין טעם לשלם לספקי ענן לפי קריאה, קל וזול בהרבה להרים אותו לוקאלית על השרת שלכם. שירות חיצוני משתלם רק אם טורקית היא לא השפה העיקרית שלכם ואתם לא רוצים לנהל עוד מודל בתשתית.

from transformers import pipeline

pipe = pipeline("text-classification", model="savasy/bert-base-turkish-sentiment-cased")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, וכל שילוב שלו במערכת ייצור של חברה חושף אתכם לסיכון של הפרת זכויות יוצרים עד לבירור מול המפרסם.

הרישיון המלא בעמוד המודל ↗