GPT
E

emotion-recognition-wav2vec2-IEMOCAP

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • audio-classification
  • Emotion
  • Recognition
  • wav2vec2

פתרון קל משקל לסיווג רגשות מתוך הקלטות קול באנגלית. הוא נשען על wav2vec2 ומתאים למי שרוצה זיהוי אודיו מקומי בלי להסתמך על שירותי ענן יקרים.

  • 361 MBמשקל הקבצים
  • 43,350הורדות בחודש
  • 189לייקים

מה זה

מדובר במודל לסיווג אודיו שלוקח קובץ קול ומזהה את הרגש של הדובר מתוכו. הוא בנוי על גבי wav2vec2 base, משלב שכבות קונבולוציה עם בלוקים רזידואליים, ומשתמש במנגנון attentive statistical pooling כדי לחלץ את הייצוגים הווקטוריים של הדיבור. האימון עצמו נעשה בעזרת פונקציית מחיר מסוג Additive Margin Softmax Loss, שנועדה להפריד בצורה חדה בין מאפייני הדוברים והרגשות.

במבחני הביצועים על מערך הבדיקה של IEMOCAP המודל מציג דיוק של 78.7 אחוזים, עם ממוצע של 75.3 אחוזים לאורך הריצות. במספרים האלה מדובר בתוצאה סבירה לגמרי למשימה מורכבת כמו זיהוי רגש, אבל המשמעות היא גם שאחד מכל ארבעה קטעי קול יקבל תיוג שגוי אפילו בתנאי מעבדה. הקוד מבצע המרה אוטומטית לערוץ מונו ודגימה מחדש של 16 קילו הרץ בזמן הקריאה, כך שלא צריך להכין מראש פייפליין מורכב לעיבוד האודיו.

מתאים ל

  • ניתוח שיחות באנגלית

    הוא מזהה כעס או תסכול בהקלטות מוקדי שירות באנגלית, ומספק סיווג בסיסי בעלות חישוב אפסית.

  • מחקר אקדמי בתחום השמע

    בסיס השוואה מצוין למי שבוחן ארכיטקטורות שונות על מערך IEMOCAP המוכר.

  • אינטראקציה קולית במשחקים

    זיהוי תגובת השחקן בקול בזמן אמת ללא צורך בכרטיס מסך חזק, בזכות משקל נמוך במיוחד.

איפה זה נופל

הבעיה המרכזית שלו היא שהוא אומן אך ורק על מאגר IEMOCAP, שמכיל שחקנים דוברי אנגלית בתנאים מבוקרים. המפתחים עצמם מצהירים בכרטיס שאין שום התחייבות לביצועים דומים על מערכי נתונים אחרים. בעולם האמיתי יש רעשי רקע, מיקרופונים שונים וסגנונות דיבור אחרים לגמרי. בנוסף, המודל מוגבל לשפה האנגלית בלבד, כך שאם תנסו לזרוק עליו הקלטות בעברית תקבלו תוצאות אקראיות ולא אמינות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי לזהות רגש של דוברי עברית?

לא. המודל אומן על קבצי קול באנגלית בלבד. המאפיינים האקוסטיים והאינטונציה של עברית שונים, והמפתחים מציינים במפורש שהוא לא נבדק על מקורות מידע אחרים.

איזה כרטיס מסך נדרש כדי להריץ את המודל הזה בסביבת ייצור?

המודל שוקל 361 מגה בייט בלבד, ולכן אפשר להריץ אותו בקלות גם על מעבד רגיל. אם יש לכם נפח תעבורה גבוה ואתם רוצים מהירות מקסימלית, כרטיס מסך בסיסי עם תמיכת cuda יספיק מעל ומעבר.

איך מריצים

כדי להריץ אותו מתקינים את גרסת הפיתוח של ספריית speechbrain ישירות ממאגר הגיטהאב שלהם. טעינת המודל מתבצעת בעזרת הפונקציה foreign_class מתוך הספרייה, יחד עם קובץ ממשק ייעודי שמגיע עם המאגר. משם פשוט מפעילים את הפונקציה שמקבלת נתיב לקובץ קול ומחזירה את התפלגות ההסתברויות, הציון, האינדקס ושם הרגש שזוהה.

הקבצים שוקלים בסך הכל 361 מגה בייט, כך שהוא ירוץ בלי בעיה גם על מעבד רגיל במחשב פיתוח בסיסי. אם אתם מעבדים כמויות גדולות של הקלטות, אפשר להעביר אותו לרוץ על כרטיס מסך פשוט באמצעות הגדרת cuda בהגדרות ההרצה. בממדים האלה אין שום סיבה אמיתית לשלם על API חיצוני, אלא אם אתם לא רוצים לנהל שרת בעצמכם.

pip install -U huggingface_hub
hf download speechbrain/emotion-recognition-wav2vec2-IEMOCAP

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש של המודל בתוך המוצר שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗