GPT
W

wav2vec2-large-robust-12-ft-emotion-msp-dim

קוד פתוח

audeeringcc-by-nc-sa-4.02022-04-06

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • speech

המודל הזה מנתח רגש מתוך קול ומחזיר שלושה ממדים רציפים במקום תגיות פשוטות. הוא מתאים למי שרוצה להבין עוררות ודומיננטיות בדיבור, ולא רק לחפש שמח או עצוב.

  • 165Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 983,821הורדות בחודש
  • 173לייקים

מה זה

במקום לחלק דיבור לקטגוריות שרירותיות של רגשות, המודל מקבל גל קול גולמי ומודד שלושה צירים: רמת עוררות, דומיננטיות וערכיות רגשית בטווח של אפס עד אחת בקירוב. הוא מחזיר גם את הווקטורים המקובצים מהשכבה האחרונה, מה שמאפשר להשתמש בו לחילוץ מאפיינים למודלים אחרים.

הבסיס כאן הוא מודל רובסטי שעבר חיתוך אגרסיבי של חצי מהשכבות, מ־24 ל־12, ואז כיוונון עדין על דאטה־סט של פודקאסטים בשם MSP-Podcast בגרסה 1.7. הקיצוץ הזה השאיר אותו עם 165 מיליון פרמטרים, קל בהרבה מהמודל המקורי אבל עדיין מסוגל לעבד רגש מדיבור חופשי ולא מאולץ.

מתאים ל

  • ניתוח עניין בפודקאסטים

    מדידת ציר העוררות והדומיננטיות של הדוברים לאורך שיחה באנגלית.

  • חילוץ וקטורים לדיבור

    שימוש בשכבה האחרונה כדי לייצר ייצוגים לקול עבור מודלים נוספים.

  • מחקר אקדמי על רגש

    בדיקת מתאם קולי בממדים רציפים במקום תיוג קטגוריאלי גס.

איפה זה נופל

המודל אומן על אנגלית בלבד ומתוך פודקאסטים, כך שהוא מותאם לתנאי הקלטה מסוימים מאוד. אי אפשר לצפות ממנו לתת תוצאות אמינות על דיבור בעברית או על שיחות מוקלטות מטלפון באיכות ירודה בלי לבדוק אותו מחדש. בנוסף, חיתוך 12 השכבות חוסך משאבים, אבל הוא מגיע על חשבון עומק הייצוג בהשוואה למודל המלא.

שאלות
נפוצות

האם המודל יזהה רגש בהקלטות בעברית?

הוא אומן רק על אנגלית מתוך מאגר פודקאסטים. סביר להניח שרמת העוררות תגיב לעוצמת הקול, אבל הערכיות והדומיננטיות בעברית לא נבדקו ועלולות להטעות לחלוטין.

אפשר לשלב אותו באפליקציה בתשלום?

לא. הרישיון אוסר מפורשות על שימוש מסחרי מכל סוג. המפתחים מציינים במפורש שרישיון מסחרי למודל רחב יותר זמין לרכישה דרכם.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון, והמשקל שלו שיושב על 1.2 ג'יגה־בייט מאפשר להריץ אותו אפילו על מעבד סביר בלי להיחנק. מי שרוצה ביצועים מהירים יותר בפרודקשן יכול להוריד גרסת ONNX מוכנה מקישור זנודו שמצורף לתיעוד שלו.

אם אתם צריכים רק לבדוק תאימות או לסווג קבצים בודדים, אין סיבה להקים תשתית כבדה, כרטיס מסך בסיסי או מחשב פיתוח מקומי יספיקו לגמרי לניסויים האלה.

from transformers import pipeline

pipe = pipeline("audio-classification", model="audeering/wav2vec2-large-robust-12-ft-emotion-msp-dim")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. זה אומר מחקר בלבד, ללא שום שימוש מסחרי, וכל נגזרת חייבת להיות תחת אותו רישיון. מי שרוצה להכניס את היכולת הזו למוצר אמיתי ייאלץ לפנות ליוצרים כדי לקנות רישיון מסחרי לדגם הרחב שלהם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗