GPT
S

sepformer-wsj02mix

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • Source Separation
  • Speech Separation
  • Audio Source Separation
  • WSJ02Mix

הפרדת שני דוברים מקובץ שמע בודד. פתרון קל משקל של 108 מגה בייט שמיועד לחלץ ערוצי דיבור נקיים מהקלטה מעורבבת.

  • 108 MBמשקל הקבצים
  • 6,547הורדות בחודש
  • 79לייקים

מה זה

המודל הזה לוקח קובץ שמע שבו שני אנשים מדברים יחד ומפצל אותו לשני קבצים נפרדים, אחד לכל דובר. הוא מבוסס על ארכיטקטורת SepFormer שנבנתה בתוך ספריית SpeechBrain, ומבצע משימת audio-to-audio ללא תלות במלל עצמו.

במדדי הבדיקה על מאגר WSJ0-2Mix הוא מציג שיפור יחס אות לרעש של 22.4 דציבל ב־SI-SNRi ו־22.6 דציבל ב־SDRi. המספרים האלה מעידים על הפרדה חדה מאוד בתנאי מעבדה, כמעט בלי זליגה של קול מדובר אחד לשני, אבל צריך לזכור שהנתונים האלה נמדדו על מערך נתונים ספציפי ונקי.

מתאים ל

  • פיצול שיחות מוקלטות

    הפרדת שני משתתפים שמדברים בו-זמנית בשיחת טלפון שהוקלטה בערוץ מונו אחד.

  • שיפור תמלול אוטומטי

    ניקוי קובץ שמע עם דיבור חופף לשני ערוצים נפרדים לפני שליחה למנוע זיהוי דיבור.

  • עיבוד קול מקומי וזול

    הרצה מקומית על מחשב פשוט או שרת קטן בלי צורך במאיצי חומרה יקרים או שירותי ענן.

איפה זה נופל

המגבלה הכי קשה כאן היא התאמה לעולם האמיתי. הצוות שפרסם את המודל מצהיר במפורש שאין שום התחייבות לביצועים על מאגרי מידע אחרים. המודל אומן על אנגלית בלבד ובתנאי אולפן של WSJ0-2Mix.

בנוסף, הוא מוגבל לשני דוברים בלבד ובקצב 8kHz. ברגע שיש רעשי רקע של רחוב, מוזיקה, שיחה של שלושה אנשים או מבטאים כבדים שלא דומים לדאטה המקורי, איכות ההפרדה עלולה להתרסק. תבדקו אותו על הקלטות אמיתיות שלכם לפני שאתם בונים עליו.

שאלות
נפוצות

האם אפשר להשתמש בו להקלטות עם שלושה דוברים ומעלה?

לא. המודל הזה אומן נקודתית על תערובות של שני דוברים בלבד. הוא תמיד ינסה לחלק את הסיגנל לשני ערוצים, ובמצב של דובר נוסף התוצאה תהיה מעורבבת ומקוטעת.

האם הוא יעבוד טוב על הקלטות בעברית?

המודל הוגדר ואומן על דאטה באנגלית בלבד. מכיוון שמדובר בהפרדת תדרים אקוסטית ולא בזיהוי מילים הוא עשוי להפריד קולות גם בשפות אחרות, אבל הביצועים לא נבדקו וצריך לבחון אותם ידנית.

איך מריצים

מתקינים את ספריית speechbrain ב־pip וטוענים את המשקלים ישירות דרך הקוד עם torchaudio. הוא שוקל רק 108 מגה בייט, כך שכל מעבד מודרני מריץ אותו בלי בעיה, ואם מוסיפים דגל של cuda אפשר לעבד איתו כמויות גדולות על כרטיס מסך פשוט מאוד.

קלט השמע חייב להיות בערוץ בודד ובקצב דגימה של 8kHz בדיוק. אם הקובץ שלכם הוקלט באיכות אחרת, חובה להמיר אותו מראש בכלים כמו torchaudio או sox לפני ששולחים אותו לפונקציית ההפרדה.

pip install -U huggingface_hub
hf download speechbrain/sepformer-wsj02mix

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗