GPT
S

spkrec-xvect-voxceleb

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • embeddings
  • Speaker
  • Verification
  • Identification

מחלץ וקטורים לזיהוי דוברים ששוקל בקושי 31.5 מגה בייט. בחירה טובה אם אתם צריכים לזהות מי מדבר בהקלטה בלי להעמיס תשתית כבדה ויקרה.

  • 31.5 MBמשקל הקבצים
  • 6,522הורדות בחודש
  • 65לייקים

מה זה

מדובר במימוש של ארכיטקטורת TDNN עם pooling סטטיסטי מתוך ספריית SpeechBrain, שנועד למשימות של אימות דובר. הוא מאומן על שילוב של Voxceleb 1 ו־Voxceleb 2, ומפיק ייצוג וקטורי מתוך קטע שמע כדי שתוכלו להשוות בין קולות שונים.

במבחן על Voxceleb1-test הנקי הוא מציג שגיאה של 3.2 אחוזים ב־Equal Error Rate. זה אומר שבמצב מאוזן בין זיהוי שגוי לדחייה שגויה, הוא עדיין יפספס בערך שלוש מתוך מאה בדיקות בתנאים נקיים, כך שהוא מתאים לסינון ראשוני או למערכות פנימיות ולא לאבטחה קריטית.

מתאים ל

  • אימות דובר באנגלית

    חילוץ וקטורים והשוואת קול של משתמש מול דגימת בסיס, מתאים למערכות שירות לקוחות.

  • חלוקת שמע לדוברים

    עוזר להבדיל מתי אדם אחד הפסיק לדבר ואחר התחיל בהקלטה, הודות למשקל הזעיר שלו.

  • חיפוש קול בארכיון

    מיפוי הקלטות קודמות לפי חתימת קול של דובר מסוים בלי צורך בחומרה יקרה.

איפה זה נופל

היוצרים של SpeechBrain מבהירים במפורש שהם לא מבטיחים שום ביצועים מחוץ לסטים שעליהם הוא נבדק. המודל אומן על אנגלית בלבד, כך שאם תזרקו עליו עברית, מבטאים מקומיים או הקלטות טלפוניות רועשות, יחס השגיאות כנראה יעלה משמעותית.

הוא מצפה לשמע של 16kHz בערוץ בודד. אם אתם משתמשים ב־encode_batch ישירות ולא ב־classify_file, האחריות על המרת התדר והורדה לערוץ מונו היא כולה עליכם, אחרת התוצאות ייפגעו בלי שתקבלו שגיאה ברורה.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי דוברים בעברית?

הוא אומן על Voxceleb שמכיל אנגלית, ולכן דיוק המודל על עברית אינו מובטח. תצטרכו לדגום הקלטות מקומיות ולבדוק את שיעור השגיאה בעצמכם לפני שתסתמכו עליו.

האם הוא מסוגל לחלץ טקסט מתוך ההקלטה?

לא, הוא אינו מודל לתמלול. כל תפקידו הוא לקחת קובץ קול ולהוציא ממנו ייצוג מספרי שמזהה את מאפייני הדובר לצורך השוואה מול קולות אחרים.

איך מריצים

טוענים אותו ישירות דרך ספריית speechbrain בפייתון באמצעות הפונקציה EncoderClassifier.from_hparams עם torchaudio. הוא רץ בלי שום בעיה על מעבד רגיל של מחשב נייד או שרת פשוט, אבל אפשר להעביר לו פרמטר cuda כדי לנצל כרטיס מסך אם אתם מעבדים כמויות גדולות במקביל.

אין שום סיבה לשלם על API חיצוני בשביל מודל כזה. הקבצים שוקלים 31.5 מגה בייט בסך הכל, מה שאומר שאפשר להרים אותו ישירות בקוד שלכם בלי לנהל שרתים מנופחים ובלי לחשוף נתוני קול רגישים החוצה.

pip install -U huggingface_hub
hf download speechbrain/spkrec-xvect-voxceleb

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי בקוד פתוח וגם במוצרים מסחריים סגורים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים. מותר להטמיע אותו בשרתים של החברה או להפיץ אותו ללקוחות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗