GPT
W

wav2vec2-large-robust-24-ft-age-gender

קוד פתוח

audeeringcc-by-nc-sa-4.02023-09-04

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • speech

הוא מנתח הקלטת קול גולמית ופולט הערכת גיל מנורמלת והסתברות לגבר, אישה או ילד. פתרון ממוקד כשצריך סיווג דמוגרפי מהיר מאודיו בלי לתמלל קודם את הטקסט.

  • 318Mפרמטרים
  • 2.4 GBמשקל הקבצים
  • 2,486,814הורדות בחודש
  • 59לייקים

מה זה

מדובר בהתאמה של wav2vec 2.0 עם 24 שכבות שאומנו במלואן על ארבעה מאגרי מידע מוכרים, ביניהם Mozilla Common Voice ו־Voxceleb 2. הוא מקבל אות אודיו ישיר, ומעבר לתחזיות הגיל והמגדר הוא גם מחזיר את המצבים המקובצים של השכבה האחרונה, מה שמאפשר להשתמש בו לייצוג וקטורי של הקול.

הגיל מוחזר בסקאלה של אפס עד אחד, שמייצגת בערך אפס עד מאה שנים. המגדר מחולק להסתברויות בין שלוש קטגוריות: ילד, אישה וגבר. במקום לבנות צינור כבד שממיר דיבור לטקסט ורק אז מנחש מי הדובר, הוא עושה את זה ישירות מהגל עצמו.

מתאים ל

  • סינון שיחות במוקדים

    ניתוב אוטומטי של פניות לפי פרופיל גיל משוער או זיהוי ילדים שמתקשרים לקווי שירות.

  • ניתוח דמוגרפי של פודקאסטים

    הערכת התפלגות הדוברים והגילאים בקובצי שמע מרובי משתתפים ללא צורך בתמלול מלא.

  • חילוץ וקטורים לקול

    שימוש בשכבה האחרונה של המודל כדי לייצר ייצוג מספרי להשוואת קולות ומאפייני דיבור.

איפה זה נופל

המודל מוגבל לשלוש קטגוריות מגדר בלבד ולא יודע להתמודד עם שום הגדרה מחוץ לטווח הזה. בנוסף, הערכת הגיל היא קירוב רציף בלבד, וקולות חריגים או איכות הקלטה ירודה עלולים להטות את התוצאה בצורה חדה. הנתונים לא מפרטים ביצועים על מבטאים ספציפיים או שפות שאינן אנגלית, ולכן צריך לבדוק אותו מראש על הקלטות בעברית לפני שמסתמכים עליו.

שאלות
נפוצות

האם המודל מתאים לזיהוי דוברים בעברית?

האימון נעשה על מאגרים בינלאומיים כמו Common Voice, אבל לא צוין כיול מיוחד לעברית. מאפייני גובה קול ותדרים עובדים בצורה דומה בין שפות, אבל מבטא ואינטונציה מקומית עלולים להשפיע, ולכן חובה להריץ בדיקה על מדגם מקומי.

איך מקבלים את הגיל האמיתי בשנים מתוך הפלט?

המודל מוציא מספר בין אפס לאחד, שמייצג טווח של אפס עד מאה. כדי לקבל הערכת שנים גסה, פשוט מכפילים את ערך הפלט במאה.

איך מריצים

טוענים אותו דרך ספריית transformers הרגילה, והקבצים תופסים 2.4 גיגה-בייט בזיכרון בדיוק של float32. עם 318 מיליון פרמטרים אפשר להריץ אותו בקלות על כרטיס מסך בסיסי או אפילו על מעבד סביר אם לא מעבדים כמויות ענק של אודיו במקביל.

ליוצרים יש גם גרסת ONNX זמינה להורדה חיצונית אם אתם צריכים סביבת ריצה קלה יותר או הטמעה ב־C++. אם אתם בונים שירות פנימי לעיבוד קבצים בדיעבד, אין סיבה לפנות ל־API חיצוני, ההרצה המקומית פשוטה וזולה.

from transformers import pipeline

pipe = pipeline("audio-classification", model="audeering/wav2vec2-large-robust-24-ft-age-gender")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, וזה אומר שאסור להשתמש בו לשימוש מסחרי מכל סוג. אם אתם מתכננים למכור מוצר, להטמיע אותו בשירות בתשלום או להשתמש בו בחברה עסקית, אתם לא יכולים לגעת בו. בנוסף, כל שינוי או פיתוח נגזר חייב להיות מופץ תחת אותו הרישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗