GPT
P

PlayDiffusion — הדגמה

קוד פתוח

PlayHTapache-2.02025-05-27

  • gradio

הדגמה לעריכת דיבור נקודתית, המרת טקסט לקול והחלפת קולות באודיו קיים. מיועדת ליוצרי תוכן וחוקרים שרוצים לשנות מילים בהקלטה בלי להקליט מחדש.

  • 9.6 GBמשקל הקבצים
  • הורדות בחודש
  • 119לייקים

מה זה

מעלים קובץ קול או מקליטים ישירות דרך המיקרופון. בלשונית העריכה מפעילים זיהוי דיבור שמחלץ את המילים וזמני ההופעה שלהן, מקלידים את הטקסט החלופי הרצוי ומריצים את העיבוד לקבלת קובץ שמע מעודכן. בנוסף קיימות לשוניות של טקסט לדיבור לפי קול נתון, והמרת קול מקובץ מקור לקול יעד.

מאחורי הקלעים פועל מודל המבוסס על ארכיטקטורת שנאי דקודר של Llama עם מנגנון קשב לא סיבתי, שמאפשר להתחשב בהקשר שלפני ואחרי המילה הנערכת. המערכת מקודדת את השמע לאסימונים בדידים, ממסכת את המקטע המיועד להחלפה, ומבצעת דה רעש באיטרציות לפי רמות ביטחון של המודל. בסיום, מודל BigVGAN מחזיר את האסימונים לגל קול יחד עם מאפייני הדובר המקורי.

מתאים ל

  • תיקון מילים בהקלטות קול

    החלפת מילה שגויה בדיבוב או פודקאסט באנגלית בלי להקליט את כל המשפט מחדש.

  • קריינות מטקסט לפי דוגמה

    הפקת שמע מטקסט חופשי תוך שמירה על גוון הקול של קובץ שמע קיים.

  • החלפת קול של דובר

    המרת דיבור קיים מקול אחד לגוון קול של דובר אחר באמצעות קובץ יעד.

איפה זה נופל

ההדגמה מוגדרת רשמית לאנגלית בלבד, בין היתר בגלל מקודד טקסט של עשרת אלפים אסימונים שנבנה במיוחד לשפה זו, כך שאין תמיכה בעברית. שלב זיהוי הדיבור דורש מפתח תוכנה של OpenAI כדי להפיק תמלול וזמני מילים, ולכן הממשק אינו עומד בפני עצמו אלא תלוי בגורם חיצוני. מודל הדיפוזיה עלול לפספס תזמונים בהחלפות ארוכות או מורכבות.

שאלות
נפוצות

האם אפשר להשתמש בהדגמה כרגע?

לא, הסטטוס שלה מוגדר כמושהה בעמוד. כדי להפעיל אותה יש צורך להוריד את הקוד ולהריץ אותו באופן עצמאי. ללא הפעלה מחדש של השרת, הדף אינו זמין לעבודה.

האם המודל תומך בדיבור בעברית?

לא, הממשק מצהיר במפורש שהפיתוח מכוון לשפה האנגלית. בנוסף, מקודד הטקסט צומצם לעשרת אלפים אסימונים באנגלית כדי לחסוך זיכרון. ניסיון לעבד עברית יניב שגיאות או פלט מקוטע.

האם ניתן להריץ את הקוד באופן מקומי?

כן, הקוד מספק הוראות התקנה דרך סביבת פייתון והתקנת תלויות. עם זאת, נדרש להגדיר מפתח תוכנה של OpenAI כדי להפעיל את זיהוי הדיבור וזמני המילים. בלעדיו שלב עריכת הקול המקומית לא יעבוד.

מה נדרש כדי לבצע עריכת מילים בקובץ?

מעלים קובץ שמע ומריצים את מודל זיהוי הדיבור שמחלץ את המילים וזמני הופעתן. לאחר מכן מקלידים את השינוי הרצוי בתיבת הטקסט ומפעילים את מחולל הדיפוזיה. המודל מחליף רק את המקטע ששונה ומחזיר שמע מתוקן.

איך מריצים

נכון לעכשיו ההדגמה נמצאת במצב מושהה ולא ניתן להריץ אותה ישירות בדפדפן. בקוד המקורי, תהליך העריכה מחייב לחיצה על כפתור זיהוי הדיבור, עריכת תיבת הטקסט, ולחיצה על כפתור ההרצה. מתחת למכסה המנוע מוגדר מעבד בסיסי, מה שמעיד על פעולה איטית מאוד בעיבוד אותות ודיפוזיה של שמע ללא מאיץ גרפי ייעודי.

pip install -U huggingface_hub
hf download PlayHT/PlayDiffusion

הרישיון

הרישיון של המרחב לא דווח. ללא הגדרה רשמית בקוד, אין היתר שימוש מסחרי מובטח, ולא ידוע מה מדיניות השמירה או העיבוד לגבי קובצי קול שמועלים לדף.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗