GPT
W

wespeaker-voxceleb-resnet34-LM

קוד פתוח

pyannotecc-by-4.02023-11-13

  • pyannote-audio
  • pytorch
  • pyannote
  • pyannote-audio-model
  • wespeaker

מעטפת פשוטה להפקת וקטורים של קול וזיהוי דוברים על בסיס WeSpeaker. הוא שוקל גרושים, רץ ישירות בתוך פייתון ומשתלב ישר באקוסיסטם של pyannote.

  • 25.4 MBמשקל הקבצים
  • 6,341,726הורדות בחודש
  • 168לייקים

מה זה

מדובר בעטיפה שמחברת את המודל המאומן של WeSpeaker ישירות לתוך pyannote.audio בגרסה 3.1 ומעלה. הוא לוקח קובץ קול, שלם או חתוך למקטעים, וממיר אותו למערך נומרי שמייצג את גוון הקול של הדובר. משם, חישוב מרחק קוסינוס פשוט בין שני וקטורים אומר לכם בדיוק אם מדובר באותו אדם או בשני אנשים שונים.

המשקל שלו מגוחך, בסך הכול 25.4 מגה בייט בארבעה קבצים, והוא מבוסס על אימון שנעשה מראש על דאטה סט VoxCeleb בשיטת ResNet34. במקום להסתבך עם סביבות עבודה נפרדות כדי להריץ את WeSpeaker, אתם מקבלים אינטגרציה נקייה לקוד קיים שכבר עובד עם המבנים של pyannote.

מתאים ל

  • אימות קולי

    השוואת וקטור מקובץ חדש מול וקטור שמור במערכת כדי לוודא שזה אותו הדובר.

  • פילוח דוברים מותאם

    חילוץ וקטורים בחלון נע כדי לקבץ מקטעי שיחה שונים לפי זהות הדובר.

  • סינון והפרדת אודיו

    זיהוי קטעים בהקלטה שבהם מדבר אדם ספציפי מתוך רשימת משתתפים ידועה מראש.

איפה זה נופל

המודל הזה יודע רק לחלץ וקטורים מקול, הוא לא עושה דיאריזציה שלמה לבד, לא מתמלל, ולא מנחש מתי מישהו התחיל לדבר. הוא אומן על VoxCeleb, מה שאומר שהביצועים שלו תלויים מאוד באיכות ההקלטה, ברעשי רקע ובמידת ההתאמה לשפות שונות או למבטאים שלא מיוצגים שם טוב. בנוסף, המפתחים מודים בעקיפין שהוא לא הפסגה הטכנולוגית שלהם כשהם מפנים לשירות בתשלום שלהם למי שמחפש תוצאות מהירות וטובות יותר בפרודקשן.

שאלות
נפוצות

האם המודל הזה מתמלל שיחות?

לא, הוא לא מודל שפה ולא הופך קול לטקסט. התפקיד היחיד שלו הוא להקשיב לאודיו ולפלוט ייצוג מתמטי של הדובר כדי שתוכלו להשוות אותו לקולות אחרים.

מה צריך להתקין כדי שהוא יעבוד?

אתם צריכים את ספריית pyannote.audio מגרסה 3.1 ומעלה יחד עם התלויות שלה כמו PyTorch וספריות scipy לעיבוד מתמטי. אין צורך להתקין את כל המאגר של WeSpeaker בנפרד.

איך מריצים

טוענים אותו עם מחלקת Model מתוך pyannote.audio ומריצים בעזרת Inference. אפשר לדגום קובץ שלם, לחתוך קטע ספציפי לפי שניות, או לעבוד עם חלון נע שרץ לאורך ההקלטה בקפיצות מוגדרות. המשקל הזעיר שלו אומר שלא צריך שרת כבד, הוא עולה בשניות ורץ גם על מעבד רגיל, אבל אפשר כמובן להעביר אותו לכרטיס מסך עם פקודת to בודדת אם רוצים תפוקה גבוהה.

המפתחים עצמם מציעים כבר בראש העמוד לעבור לשירות הענן המסחרי שלהם אם אתם בונים מערכת פרודקשן וצריכים ביצועים מהירים או חזקים יותר. אם הפרויקט שלכם קטן או שאתם חייבים להריץ הכל מקומית אצלכם בשרת, הגרסה הזו מספיקה לגמרי וחוסכת תלות בצד שלישי.

pip install -U huggingface_hub
hf download pyannote/wespeaker-voxceleb-resnet34-LM

הקבצים

4 קבצים במאגר, 25.4 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-4.0, שנגזר ישירות מתנאי השימוש של הדאטה סט VoxCeleb שעליו המודל אומן. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולהפיץ אותו הלאה, בתנאי שאתם נותנים קרדיט מתאים ליוצרים המקוריים של WeSpeaker ושל pyannote.audio.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗