GPT
S

spkrec-ecapa-voxceleb

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • embeddings
  • Speaker
  • Verification
  • Identification

הכלי מזהה דוברים ומפיק וקטורי קול ייחודיים מקבצי אודיו. משתמשים בו כדי להשוות בין שתי הקלטות ולקבוע אם אותו אדם מדבר בשתיהן.

  • 85.0 MBמשקל הקבצים
  • 2,104,029הורדות בחודש
  • 345לייקים

מה זה

המודל מבוסס על ארכיטקטורת ECAPA-TDNN, שמשלבת שכבות קונבולוציה עם בלוקים שאריתיים ומנגנון attentive statistical pooling. הוא אומן על מאגרי VoxCeleb 1 ו־VoxCeleb 2 באמצעות Additive Margin Softmax Loss, ומחשב מרחק קוסינוס בין וקטורי קול כדי להחליט על זהות הדובר. בדיקות על סט המבחן הנקי של VoxCeleb 1 הציגו שיעור שגיאה של 0.80 אחוזים, שמעיד על דיוק גבוה מאוד בזיהוי התאמות בתנאי מעבדה.

במשקל של 85 מגה-בייט בלבד הוא נחשב קל ומהיר, מה שהופך אותו לבחירה נפוצה למיצוי ייצוגי קול בלי צורך בתשתיות כבדות. מעבר להשוואת קבצים פשוטה, הוא מחזיר ייצוגים מתמטיים של הדובר שמתאימים למשימות סיווג, זיהוי מתחזים או הפרדת דוברים במערכות שמע.

מתאים ל

  • אימות זהות קולית

    השוואה בין הקלטה בזמן אמת לדגימת קול שמורה לצורך אימות משתמשים.

  • הפקת וקטורי קול

    חילוץ ייצוגי שמע מספריים לצורך חיפוש דוברים דומים במסדי נתונים.

  • חלוקת אודיו לדוברים

    זיהוי מתי מתחלף הדובר בהקלטה מרובת משתתפים לצורך תמלול מסודר.

איפה זה נופל

המפתחים מצהירים במפורש שאין שום ערובה לביצועי המודל על מאגרי מידע שאינם VoxCeleb. האימון התבסס כולו על אנגלית, ולכן התנהגות המודל בעברית, במבטאים שונים או באיכויות הקלטה של קווי טלפון וסביבות רועשות עלולה לרדת מהנתון הרשמי. חובה לבדוק אותו על מדגם הקלטות אמיתי מהשטח לפני שסומכים עליו בזיהוי משתמשים.

שאלות
נפוצות

האם צריך כרטיס מסך חזק כדי להריץ אותו בשרת?

לא. המודל שוקל 85 מגה-בייט ומסוגל לרוץ ביעילות גם על מעבד רגיל, במיוחד לבדיקות בודדות. שימוש במעבד גרפי נדרש בעיקר לעיבוד מקבילי של קבצים רבים בזמן אמת.

האם הוא יעבוד טוב עם הקלטות בעברית?

האימון נעשה על נתונים באנגלית בלבד. אף על פי שמאפייני קול מסוימים חוצים שפות, הביצועים לא מובטחים וצריך לבצע בדיקות מקיפות על אודיו מקומי.

איך מריצים

מתקינים את ספריית speechbrain באמצעות pip ישירות ממאגר הגיטהאב ומריצים את המודל בפייתון בעזרת מחלקות המעטפת המובנות. המשקל הזעיר מאפשר להריץ אותו ישירות על מעבד רגיל של שרת או מחשב מקומי, אך ניתן גם להעביר לו פרמטר ייעודי לריצה על גבי מעבד גרפי של אנבידיה עם CUDA לקבלת מהירות גבוהה יותר בעיבוד כמויות גדולות.

המערכת מצפה לאודיו בערוץ יחיד בקצב דגימה של 16 קילו-הרץ. פונקציות הבדיקה הבסיסיות של הספרייה מבצעות המרה ודגימה מחדש באופן אוטומטי מקבצים, אך מי שמעביר טנסורים ישירות למיצוי וקטורים צריך לדאוג שהקלט מכויל בדיוק לנתונים האלה כדי לא לקבל תוצאות שגויות.

pip install -U huggingface_hub
hf download speechbrain/spkrec-ecapa-voxceleb

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, הפצה, שינוי הקוד והטמעה במוצרים סגורים. התנאים היחידים הם שמירה על הודעות זכויות היוצרים המקוריות, צירוף עותק של הרישיון וציון אם בוצעו שינויים בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗