GPT
D

distilcamembert-base-sentiment

קוד פתוח

cmarkeamit2022-03-02

  • transformers
  • pytorch
  • tf
  • onnx
  • safetensors

פתרון קל משקל לניתוח סנטימנט בצרפתית שמסווג טקסט לפי דירוג של 1 עד 5 כוכבים. הוא מציע מהירות כפולה מדגמי CamemBERT מלאים על חומרה בסיסית.

  • 68Mפרמטרים
  • 514טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 16,298הורדות בחודש

מה זה

המודל מבצע סיווג סנטימנט בצרפתית על בסיס ארכיטקטורה מזוקקת של 68 מיליון פרמטרים ושישה שכבות בלבד. הוא אומן על שילוב של ביקורות מוצרים קצרות מאמזון וביקורות סרטים ארוכות ומפורטות מאתר Allocine, במטרה להתמודד עם סגנונות כתיבה שונים.

בסיווג מדויק לחמישה כוכבים הוא מגיע לדיוק של 61.01 אחוזים, אבל במדידת טופ 2, כלומר פגיעה בכוכב הנכון או סטייה של כוכב אחד בלבד, הדיוק קופץ ל־88.8 אחוזים. כשמצמצמים את הבעיה לבינארית של חיובי מול שלילי ומתעלמים מדירוג 3 הניטרלי, הדיוק עומד על 97.52 אחוזים. במבחני ביצועים על מעבד AMD Ryzen 5 4500U הוא סיים הסקה ב־95.56 מילישניות, מהר כמעט פי שניים מ־bert multilingual ופי שלושה מ־tf-allocine.

מתאים ל

  • סיווג ביקורות מוצר בצרפתית

    מזהה שביעות רצון של לקוחות על סקאלה של 1 עד 5 בדיוק גבוה כשמאפשרים סטייה קלה.

  • סינון תגובות שליליות בזמן אמת

    זמן תגובה של פחות ממאה מילישניות על מעבד רגיל מאפשר התראות מיידיות על לקוחות זועמים.

  • ניתוח משוב במערכות עם מעבד בלבד

    פועל ישירות עם ONNX על חומרה זולה בלי צורך בכרטיסי מסך יקרים.

איפה זה נופל

הוא מיועד לצרפתית בלבד, כך שטקסטים בעברית או באנגלית יקבלו תוצאות חסרות משמעות. מגבלה מרכזית נוספת היא הדיוק הנמוך יחסית בסיווג מדויק של חמישה כוכבים, שעומד על 61.01 אחוזים בלבד. קשה לו להבדיל בין כוכב אחד לשניים או בין ארבעה לחמישה, ולכן מי שבונה עליו צריך להתייחס אליו כסיווג חיובי או שלילי כללי, או לקחת מרווח שגיאה של כוכב אחד. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים, מה שדורש לחתוך טקסטים ארוכים מראש.

שאלות
נפוצות

האם המודל מתאים לניתוח טקסט בעברית?

לא. הוא אומן באופן בלעדי על טקסטים בצרפתית מאמזון ומ־Allocine. הרצה של עברית תניב סיווג שגוי לחלוטין.

האם אפשר לסמוך על דירוג הכוכבים המדויק שהוא מחזיר?

לא בדיוק. הדיוק המוחלט שלו הוא 61.01 אחוזים בלבד, אבל הוא מעולה בזיהוי כיוון כללי של חיובי מול שלילי, או בדיוק של פלוס מינוס כוכב אחד שבו הוא מגיע לכמעט 89 אחוזים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות pipeline סטנדרטי של text-classification. 68 מיליון פרמטרים ומשקל קבצים של ג'יגה בייט אחד אומרים שאין שום צורך בכרטיס מסך ייעודי. הוא רץ בקלות על מעבד של שרת פשוט או מחשב נייד, ומי שרוצה ביצועים טובים עוד יותר יכול להשתמש בגרסת ה־ONNX הקוונטית שמגיעה במאגר דרך Optimum.

בגלל המשקל הנמוך והמהירות על מעבד רגיל, אין שום סיבה כלכלית או ארכיטקטונית לשלם על API חיצוני אם אתם צריכים לנתח טקסטים בצרפתית.

from transformers import pipeline

pipe = pipeline("text-classification", model="cmarkea/distilcamembert-base-sentiment")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗