GPT
W

wav2vec2-lg-xlsr-en-speech-emotion-recognition

קוד פתוח

ehcalabresapache-2.02022-03-02

  • transformers
  • pytorch
  • tensorboard
  • safetensors
  • wav2vec2

הכלי מזהה שמונה רגשות שונים מתוך קול מוקלט באנגלית. הוא נותן פתרון מוכן מהקופסה לסיווג אודיו בלי שתצטרכו לאמן רשת מאפס.

  • 316Mפרמטרים
  • 2.4 GBמשקל הקבצים
  • 37,349הורדות בחודש
  • 251לייקים

מה זה

בבסיס יושב מודל Wav2Vec2 עם 24 שכבות וסביב 316 מיליון פרמטרים, שעבר כוונון ייעודי למשימת זיהוי רגשות בדיבור. הוא מאומן לקחת קטע שמע ולסווג אותו לאחת מתוך שמונה קטגוריות: כעס, רוגע, גועל, פחד, שמחה, ניטרליות, עצב או הפתעה.

האימון בוצע על בסיס נתונים בשם RAVDESS שמכיל 1440 הקלטות של שחקנים דוברי אנגלית. במבחן על נתוני הבדיקה הוא הגיע לדיוק של 82.23 אחוזים. זה נתון יפה למערך נתונים סגור, אבל הוא מודד ביצועים מול שחקנים מקצועיים שמבטאים רגשות מוקצנים ולא מול שיחות טלפון אמיתיות ומבולגנות.

מתאים ל

  • סינון שיחות שירות באנגלית

    זיהוי לקוחות כועסים בהקלטות תמיכה כדי לנתב אותם בעדיפות גבוהה.

  • ניתוח תגובות בראיונות מוקלטים

    סיווג אוטומטי של טונציית הדיבור לשמונה רגשות מוגדרים מראש.

  • תיוג שמע למחקר

    חלוקה מהירה של קובצי קול לפי רגש לצורך מחקרי שפה והתנהגות.

איפה זה נופל

הבעיה המרכזית היא חומר האימון. 1440 דגימות של שחקנים שמציגים רגש באנגלית זה מעט מאוד מידע, והמשחק המבוים שונה מאוד מהאופן שבו אנשים נשמעים בחיים. בעברית הוא פשוט לא יעבוד כמו שצריך, כי הפונטיקה והאינטונציה שונות לחלוטין. בנוסף, כרטיס המודל לא מפרט תרחישי כשל או מגבלות, כך שחובה לבדוק אותו על נתונים אמיתיים שלכם לפני שמחברים אותו למערכת פעילה.

שאלות
נפוצות

האם המודל מזהה רגש בהקלטות בעברית?

הוא לא אומן על עברית. האימון התבצע על שחקנים דוברי אנגלית בלבד, ולכן הסקת מסקנות לגבי אינטונציה בעברית תניב תוצאות לא אמינות.

כמה משאבים צריך כדי להריץ אותו אצלי בשרת?

הקבצים שוקלים 2.4 גיגה בייט ויש לו 316 מיליון פרמטרים. כרטיס מסך פשוט עם כמה גיגה בייט של זיכרון יריץ אותו מהר, ואפשר להריץ אותו גם על מעבד רגיל.

האם הדיוק של 82 אחוזים מספיק למוצר אמיתי?

הנתון הזה הושג על שחקנים שמקריאים משפטים ברורים. ברעש רקע, שפות מעורבות או דיבור טבעי, רמת הדיוק תהיה נמוכה משמעותית.

איך מריצים

המודל שוקל 2.4 גיגה בייט ומבוסס על ספריית transformers הסטנדרטית, כך שאפשר להרים אותו ישירות בפייתון בלי להסתבך עם התאמות מיוחדות. 316 מיליון פרמטרים זה משקל קל יחסית שרץ בקלות על כרטיס מסך בסיסי, ואפילו על מעבד רגיל אם לא מדובר בעומס חריג בזמן אמת.

אם אתם צריכים לנתח הקלטות בודדות אחת לכמה זמן, שרת קטן משלכם יעשה את העבודה בזול. הקמה של שרת ייעודי תהיה פחות משתלמת רק אם יש לכם צורך נקודתי וזמני מאוד, אבל במקרה הזה אין גרסאות גודל שונות לבחור ביניהן.

from transformers import pipeline

pipe = pipeline("audio-classification", model="ehcalabres/wav2vec2-lg-xlsr-en-speech-emotion-recognition")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗