GPT
S

SoloSpeech

רץ בדפדפן

OpenSoundcc-by-nc-4.02025-05-26

  • gradio
  • target-speech-extraction
  • speech-separation
  • voice-generation

מבודד קול של אדם ספציפי מתוך הקלטה עמוסה ברעשים או דוברים אחרים. פתרון שימושי למי שצריך לחלץ דיבור נקי מראיונות, פודקאסטים או שירים.

  • הורדות בחודש
  • 115לייקים

מה זה

מעלים שני קבצי אודיו: ההקלטה המעורבבת שבה הדובר מדבר יחד עם אחרים, ודגימת קול נקייה וקצרה של אותו אדם בלבד לצורך זיהוי. המערכת משווה את הדגימה לתערובת, מבודדת את הקול המבוקש ומפיקה קובץ אודיו בודד של הדיבור הנקי.

מאחורי הקלעים רץ שילוב של מודלי SoloSpeech יחד עם רכיבי דיפוזיה, DDIMScheduler, מודל תיקון FastGeCO וספריות SpeechBrain. זהו תהליך גנרטיבי רב שלבי שנועד לשמור על איכות הצליל והבנת הדיבור ולא רק להנמיך רעשי רקע.

הממשק כולל שלוש דוגמאות מובנות שממחישות את היכולות: חילוץ קול גבר מתוך תערובת של כמה דוברים גברים, חילוץ אישה מתוך כמה נשים, והפרדה מורכבת של ראפר מתוך שיר עם מוזיקה ושירה צפופה.

מתאים ל

  • ניקוי קול מראיונות מרובי משתתפים

    חילוץ דבריו של מרואיין ספציפי כאשר שני אנשים מדברים זה על גבי זה בו זמנית.

  • בידוד שירה מתוך מוזיקה

    הפרדת שירה של זמר או ראפר מסוים מתוך רצועת שמע הכוללת ביטים וקולות רקע.

  • הכנת אודיו לתמלול

    סינון רעשי רקע ודוברים משניים כדי לשפר קריאות של מנועי תמלול אוטומטיים.

איפה זה נופל

הצלחת ההפרדה תלויה לחלוטין באיכות דגימת הזיהוי. אם הקובץ הקצר כולל כמה דוברים, המודל יתקשה להבין מי קול המטרה. ההדגמות שמגיעות עם הכלי נבחרו בקפידה ויציגו תוצאות נקיות יותר ממה שתקבלו כנראה מהקלטה חובבנית מהטלפון.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא. הגישה לממשק פתוחה בחינם בדפדפן ואין צורך להזין פרטי תשלום או לפתוח חשבון.

מה קורה עם קבצי האודיו שאני מעלה?

הקבצים נשלחים לשרת לצורך עיבוד ההפרדה על גבי החומרה של Hugging Face. לא מומלץ להעלות חומרים רגישים או חסויים.

האם אפשר להריץ את הכלי מקומית על המחשב?

כן. הקוד משתמש במודלים ציבוריים שיושבים במאגר OpenSound/SoloSpeech-models, אך הרצה מקומית דורשת כרטיס מסך מתאים והתקנת סביבת פייתון ייעודית.

למה התוצאה לפעמים לוקחת זמן או נתקעת?

הכלי משתמש בהקצאת חומרה דינמית מסוג ZeroGPU. אם השרת עמוס במשתמשים אחרים, הבקשה עשויה להמתין בתור עד שיתפנה כרטיס גרפי לעיבוד.

איך משתמשים

בוחרים אחת מהדוגמאות המוכנות או מעלים קבצים משלכם לתיבת התערובת ולתיבת דגימת הדובר, ואז לוחצים על כפתור החילוץ. אין צורך בהרשמה או התחברות כדי להתחיל לעבוד.

העיבוד מתבצע על גבי מעבד גרפי ייעודי מסוג A10G דרך תשתית ZeroGPU. המשמעות היא שהמשאבים מוקצים רק בעת הבקשה, כך שזמן הריצה תלוי בעומס הכללי על השרת ובאורך הקבצים שהעליתם.

הרישיון

הפרויקט מפורסם תחת רישיון CC-BY-NC-4.0. המשמעות היא שהשימוש מותר למטרות מחקר, לימוד ובדיקות אישיות בלבד, ואסור לשימוש מסחרי מכל סוג.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗