GPT
S

speakerverification_en_titanet_large

קוד פתוח

nvidiacc-by-4.02022-07-15

  • nemo
  • speaker
  • speech
  • audio
  • speaker-verification

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הוא מפיק וקטורי ייצוג קוליים לזיהוי דוברים ולהפרדת דוברים בהקלטות. מפתח שצריך להשוות קולות באנגלית בלי לגרור מודלי ענק יקבל כאן פתרון ממוקד.

  • 97.1 MBמשקל הקבצים
  • 231,630הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת TitaNet עם שכבות קונבולוציה נפרדות, שמיועד לחלץ ייצוגים קוליים מקבצי שמע. הייעוד העיקרי שלו הוא אימות קולי, כלומר קביעה האם שני קטעי שמע שייכים לאותו אדם, ושימוש כתשתית לדיאריזציה כדי להבדיל בין דוברים שונים בשיחה מרובת משתתפים. למרות השם שמכיל את המילה לארג׳, הוא שוקל פחות ממאה מגהבייט ומכיל 23 מיליון פרמטרים בלבד.

במבחני ביצועים על מאגר VoxCeleb1 הנקי נמדד מדד שגיאה של 0.66 אחוזים עבור אימות דוברים. במשימות דיאריזציה, שיעור השגיאה נע בין 1.19 אחוזים במבחני CH109 לבין 6.73 אחוזים על מבחני NIST SRE 2000. התוצאות מראות דיוק גבוה מאוד בהפרדת קולות כשתנאי ההקלטה טובים, אך במאגרי בדיקה טלפוניים קשים יותר ניכרת עלייה מסוימת בכמות השגיאות.

מתאים ל

  • אימות קולי באנגלית

    השוואת שתי הקלטות קצרות באנגלית כדי לוודא שמדובר באותו משתמש.

  • הפרדת דוברים בשיחה

    חילוץ וקטורים מקטעי קול כדי לקבץ דיבור של אנשים שונים בהקלטה.

  • בסיס לכוונון בשפות אחרות

    נקודת התחלה טובה לאימון נוסף אם רוצים להתאים אותו לשמע שונה.

איפה זה נופל

האימון נעשה אך ורק על אלפי שעות דיבור באנגלית, כך שהוא לא יתאים מחוץ לקופסה לזיהוי דוברים בעברית. בנוסף, הוא אומן על שילוב של שיחות טלפון והקלטות שמע שונות, ואנבידיה מודה במפורש שאם תחום האודיו שלכם רחוק ממאגרי האימון הללו, הביצועים ייפגעו ותצטרכו לבצע כוונון עדין על הדאטה שלכם. קבצים שלא הומרו מראש למונו ול־16 קילוהרץ ייכשלו או יספקו תוצאות שגויות.

שאלות
נפוצות

האם הוא יכול לעבוד על הקלטות בעברית?

הוא אומן על אנגלית בלבד, ולכן לא מיועד לשימוש בעברית. אפשר להשתמש בארכיטקטורה ובמשקלים כבסיס לאימון נוסף על שמע מקומי, אבל בלי כוונון כזה הדיוק ייפגע משמעותית.

איזה סוג של קבצי שמע אפשר לשלוח אליו?

המודל מקבל קבצי WAV בערוץ יחיד, מונו, שנדגמו בקצב של 16000 הרץ. כל פורמט אחר או קצב דגימה שונה ידרשו המרה מוקדמת בקוד לפני השליחה למודל.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה יחד עם PyTorch. הקריאה לקוד דורשת שורות בודדות בפייתון כדי לטעון את המשקלים ישירות, להזין קובצי שמע ולקבל את הווקטור או לבצע השוואה ישירה. קלט השמע חייב להיות בפורמט WAV, ערוץ מונו בלבד ובקצב דגימה של 16 קילוהרץ.

הגודל הקומפקטי שלו, כ־97 מגהבייט, מאפשר לו לרוץ בקלות כמעט על כל מעבד מודרני בלי לחייב מאיץ גרפי ייעודי בזמן ריצה רגילה. עם זאת, אנבידיה מציינת שהמודל עדיין לא נתמך במסגרת פלטפורמת Riva שלה להאצה ופריסה בארגונים, כך שאת הפריסה והאופטימיזציה לסביבת ייצור תצטרכו להרים בעצמכם על גבי NeMo.

pip install -U huggingface_hub
hf download nvidia/speakerverification_en_titanet_large

הקבצים

5 קבצים במאגר, 97.1 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון CC-BY-4.0. הרישיון מאפשר שימוש מסחרי, שינוי, התאמה והפצה של המשקלים כחלק ממוצר שלכם, בתנאי אחד פשוט: מתן קרדיט ברור לאנבידיה על פי דרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗