GPT
M

metricgan-plus-voicebank

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • audio-to-audio
  • speech-enhancement
  • PyTorch
  • en

פתרון קל משקל לניקוי רעשי רקע מהקלטות דיבור, שרץ כמעט על כל מכשיר. הוא מתאים למי שרוצה לשפר איכות שמע במהירות ובלי להקים תשתית שרתים יקרה.

  • 7.5 MBמשקל הקבצים
  • 15,249הורדות בחודש
  • 71לייקים

מה זה

המודל מיועד לניקוי שמע ולבידוד קול אנושי מתוך רעשי סביבה. הוא מקבל קובץ אודיו של דיבור מלוכלך ומוציא אות נקי יותר, על בסיס ארכיטקטורת רשת שמאומנת ישירות למקסם מדדי איכות דיבור מקובלים. כל המשקל שלו מסתכם ב־7.5 מגה בייט, מה שהופך אותו לאחד הכלים הקטנים שקיימים למשימה הזו ברשת.

במדדי המבחן המדווחים הוא מציג ציון PESQ של 3.15 וציון STOI של 93.0 על מערך הנתונים של Voicebank. במספרים האלה, ציון STOI של 93 מעיד על רמת מובנות דיבור גבוהה מאוד אחרי הניקוי, וציון ה־PESQ מראה שיפור מורגש באיכות הכללית בלי לעוות את הקול לחלוטין. הוא אומן על אנגלית, אבל עובד ישירות על ספקטרוגרמות של גלי קול.

מתאים ל

  • קדם עיבוד לתמלול

    ניקוי קבצי שמע רועשים לפני שליחתם למנועי זיהוי דיבור כדי לשפר את הדיוק.

  • שיפור איכות שיחות

    סינון רעשי סביבה מהקלטות שיחה בטלפוניה או במערכות קשר פנימיות.

  • עיבוד על מכשירי קצה

    הטמעה מקומית במחשבים אישיים או במערכות קטנות בלי תלות בחיבור לרשת.

איפה זה נופל

המגבלה הראשונה היא סוג השמע. המודל אומן על הקלטות של 16kHz בערוץ מונו בלבד, כך שהוא לא מתאים לקבצי מוזיקה או להקלטות אולפן באיכות גבוהה. בנוסף, המפתחים מצהירים במפורש שאין ערובה לביצועים שלו על מאגרי נתונים אחרים מעבר לסט עליו הוא נבדק. בסביבות רעש שלא דומות לאימון המקורי, הוא עלול לפספס רעשים או לחתוך חלקי מילים.

שאלות
נפוצות

האם המודל דורש כרטיס מסך חזק כדי לעבוד בזמן אמת?

לא. גודל הקבצים הכולל הוא 7.5 מגה בייט בלבד, ולכן הוא רץ מצוין גם על מעבדים רגילים בלי חומרה ייעודית. אם רוצים לעבד כמויות שמע גדולות במיוחד, אפשר להעביר אותו לכרטיס מסך בעזרת הגדרת פרמטר בודד בקוד.

האם אפשר להשתמש בו לקבצי שמע סטריאופוניים באיכות גבוהה?

לא באופן ישיר. המודל אומן על הקלטות מונו בקצב של 16kHz בלבד. קריאה לפונקציות הנוחות של הספרייה תמיר את הקובץ למונו ותשנה את קצב הדגימה, אך התוצאה הסופית תמיד תהיה באיכות הזו ולא באיכות מקור גבוהה יותר.

איך מריצים

ההרצה פשוטה מאוד ודורשת התקנה של ספריית speechbrain בפייתון. מורידים את המודל בקוד באמצעות מחלקת SpectralMaskEnhancement, טוענים קובץ ומעבירים אותו בפקודת עיבוד ישירה. השמע חייב להיות בערוץ בודד ובקצב דגימה של 16kHz, אם כי הפונקציה המובנית יודעת לבצע את ההמרה הזו בעצמה כשקוראים לקובץ ישירות מהדיסק.

בגלל המשקל הזעיר שלו, אין שום צורך במעבד גרפי ייעודי בשביל להריץ אותו, ומעבד סטנדרטי יספיק לרוב השימושים. אפשר להגדיר לו לרוץ על כרטיס מסך אם רוצים לעבד כמויות גדולות של קבצים במקביל, אך אין טעם לשלם על שירותי ענן יקרים רק בשבילו.

pip install -U huggingface_hub
hf download speechbrain/metricgan-plus-voicebank

הקבצים

6 קבצים במאגר, 7.5 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים סגורים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בתוך הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗