GPT
V

vad-crdnn-libriparty

קוד פתוח

speechbrainרישיון לא דווח2022-03-02

  • speechbrain
  • VAD
  • SAD
  • Voice Activity Detection
  • Speech Activity Detection

הוא מזהה מתי מישהו מדבר בהקלטה ומחזיר זמני התחלה וסיום מדויקים. הוא שוקל פחות מעשרה מגה־בייט ומיועד למי שצריך לחתוך שקט מאודיו בלי להעמיס על השרת.

  • 9.6 MBמשקל הקבצים
  • 13,705הורדות בחודש
  • 44לייקים

מה זה

מדובר במודל מסוג CRDNN שמחשב הסתברות לקול אנושי ברמת הפריים הבודד. הוא עובר על קובץ האודיו, קובע סף החלטה, ומספק רשימת מקטעים עם סיווג ברור של דיבור או היעדר דיבור. התהליך כולל גם שלבי עיבוד נוספים כמו איחוד מקטעים צמודים והסרת מקטעים קצרים מדי כדי לייצב את התוצאה.

במבחנים על סט הבדיקה של LibriParty הוא רשם דיוק של 0.9518 וריקול של 0.9437, עם ציון F של 0.9477. המספרים האלה אומרים שהוא כמעט לא מפספס קטעי דיבור אמיתיים, אבל הם נמדדו על מערך נתונים ספציפי של מסיבות ושיחות עם רעשי רקע מסוימים.

מתאים ל

  • חיתוך שקט לפני תמלול

    הוא מנקה מקטעים ריקים ומקצר את זמן העבודה של מודלי תמלול כבדים.

  • סינון קבצים בשרת

    בגלל משקלו הזעיר הוא מתאים לפילטור ראשוני של הקלטות ללא דיבור.

  • בדיקת איכות להקלטות

    הוא מאפשר לייצר שכבת ויזואליזציה ולהשוות אותה לאודיו המקורי.

איפה זה נופל

ההגבלה הראשונה היא קלט האודיו, שמחייב בדיוק 16 קילו־הרץ וערוץ מונו אחד. בנוסף, המפתחים מציינים מפורשות שהם אינם מתחייבים לביצועים במערכי נתונים אחרים. המודל אומן על אנגלית עם אוגמנטציות מסוימות, ולכן בסביבות אקוסטיות שונות מאוד או עם רעשי רקע לא מוכרים, הזיהוי עלול לזייף ולחתוך מילים באמצע.

שאלות
נפוצות

האם הוא יעבוד טוב עם הקלטות בעברית?

הוא אומן על אנגלית, אבל מודלי זיהוי דיבור ברמת האות מתבססים בעיקר על תדרי קול אנושי ואנרגיה ולא על אוצר מילים. עם זאת, המפתחים מדגישים שהביצועים לא מובטחים על דאטה אחר, ולכן תצטרכו לבדוק אותו על הקלטות מקומיות עם המבטא והרעשים האופייניים לכם.

מה עושים אם קובץ האודיו שלי הוא ב־44.1 קילו־הרץ או בסטריאו?

הוא לא יקבל את הקובץ כמו שהוא. חובה להמיר את ההקלטה לערוץ בודד ולדגימה של 16 קילו־הרץ באמצעות כלים כמו torchaudio או sox לפני שמעבירים אותה לפונקציית הזיהוי.

איך מריצים

מתקינים את speechbrain דרך פיפ, טוענים את המחלקה ומעבירים קובץ אודיו של 16 קילו־הרץ בערוץ בודד. אם ההקלטה מגיעה בקצב דגימה אחר, צריך להמיר אותה מראש בכלים כמו torchaudio כדי לא לפגוע בזיהוי.

המודל שוקל 9.6 מגה־בייט בלבד, כך שלא צריך עבורו חומרה מיוחדת. הוא ירוץ בקלות על כל מעבד פשוט של שרת ענן או מחשב מקומי, ואין שום היגיון לשלם ל־API חיצוני רק בשביל זיהוי שקט בהיקפים כאלה. אם בכל זאת רוצים להאיץ עיבוד של כמויות עצומות של קבצים במקביל, אפשר להעביר אותו לרוץ על כרטיס מסך בהגדרה קצרה.

pip install -U huggingface_hub
hf download speechbrain/vad-crdnn-libriparty

הקבצים

8 קבצים במאגר, 9.6 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל לא דווח בעמוד שלו. משפטית, כשאין רישיון מוגדר אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, מה שדורש בדיקה מול מאגר הקוד הראשי של SpeechBrain או פנייה ישירה ליוצרים לפני שמשחררים מוצר שמסתמך עליו.

הרישיון המלא בעמוד המודל ↗