GPT
B

bert-emotion

קוד פתוח

boltuixapache-2.02025-03-27

  • transformers
  • safetensors
  • bert
  • text-classification
  • emotion

סיווג רגשות בסיסי בטקסטים קצרים באנגלית עם משקל של 43 מגה-בייט בלבד. פתרון מתאים למי שחייב להריץ מודל מקומית על מעבדים חלשים בלי לגעת בשרת חיצוני.

  • 11Mפרמטרים
  • 512טוקנים בהקשר
  • 42.9 MBמשקל הקבצים
  • 1,535הורדות בחודש

מה זה

המודל מבצע סיווג של טקסט קצר באנגלית לתוך שלוש עשרה קטגוריות רגש שונות, ביניהן שמחה, עצב, כעס, בלבול, אשמה וסרקזם. הוא מבוסס על ארכיטקטורת BERT מוקטנת של ארבע שכבות בלבד עם 11,173,901 פרמטרים. בניגוד למודלי שפה מלאים או גרסאות כמו DistilBERT ששוקלות מאות מגה-בייטים, המבנה המצומצם הזה מאפשר תגובה מיידית בתוך עשרות מילישניות.

דף המודל מציג טבלת השוואה עם ציון דיוק וציון F1 מושלמים של 1.00 מול דגמים מתחרים. בפועל, המספרים האלה מגיעים ממבחן פנימי זעיר שכלל שלוש עשרה שורות בדיקה בלבד, כך שאין להתייחס אליהם כמדד אמין לביצועים בעולם האמיתי. מדובר במודל קטן מאוד שמזהה דפוסים פשוטים במשפטים קצרים, ותו לא.

מתאים ל

  • בוטים על מכשירי קצה

    זיהוי תגובות משתמש קצרות ברובוטים או צעצועים חכמים, בזכות דרישת זיכרון של כ־60 מגה-בייט בלבד.

  • סינון הודעות אופליין

    קריאת משוב ממשתמשים באפליקציות מובייל ללא חיבור רשת לצורך מיון כעס או תסכול.

  • ניתוב שיחות לפי מצב רוח

    סיווג ראשוני של פניות צ'אט קצרות כדי להעביר משתמשים נסערים למענה אנושי במהירות.

איפה זה נופל

היוצרים מודים במפורש שהמודל נכשל לחלוטין בניתוח משפטים ארוכים, למרות חלון הקשר תיאורטי של 512 טוקנים. הנתונים מוגבלים לאנגלית בלבד, וטקסט בעברית לא יעבוד כלל. בנוסף, חלוקה לשלוש עשרה קטגוריות עם ארכיטקטורה של 11 מיליון פרמטרים מובילה לקושי מהותי בזיהוי רגשות מורכבים כמו ציניות או בושה, מעבר לדוגמאות הטריוויאליות שעליהן הוא אומן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על נתונים באנגלית בלבד. הזנת קלט בעברית תחזיר תוצאות שגויות לחלוטין.

האם נתוני הדיוק המושלמים בכרטיס המודל אמיתיים?

לא עבור שימוש אמיתי. הציון המושלם הושג על סט בדיקה של שלוש עשרה דוגמאות בודדות שהוגדרו מראש, כך שבפועל שיעור השגיאות יהיה גבוה בהרבה.

האם חובה להשתמש במעבד גרפי כדי לקבל זמני תגובה טובים?

אין שום צורך בכרטיס מסך. המודל שוקל פחות מ־43 מגה-בייט ומספק זמני ריצה של מתחת ל־45 מילישניות גם על מעבד של Raspberry Pi 4.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית transformers בפייתון באמצעות צינור סיווג טקסט רגיל. קובצי ה־float32 שוקלים 42.9 מגה-בייט ודורשים סביב 60 מגה-בייט זיכרון עבודה בזמן ריצה, כך שכל מעבד בסיסי, כולל בקרים כמו ESP32-S3 או Raspberry Pi 4, יריץ אותו בלי צורך במאיץ גרפי.

אם אתם צריכים סיווג פנימי במכשיר קצה, באפליקציית מובייל ללא אינטרנט או במערכת שדורשת פרטיות מלאה, ההרצה המקומית פשוטה וזולה. לעומת זאת, אם השרת שלכם כבר מעבד כמויות מלל מורכבות בענן, פנייה ל־API גנרי תחסוך את התחזוקה ותיתן דיוק עדיף.

from transformers import pipeline

pipe = pipeline("text-classification", model="boltuix/bert-emotion")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 42.9 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ומסמך הרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗