GPT
S

speecht5_vc

קוד פתוח

microsoftmit2023-02-02

  • transformers
  • pytorch
  • speecht5
  • audio
  • audio-to-audio

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המרת קול מאודיו לאודיו שרצה מקומית בלי לתרגם קודם לטקסט. פתרון קל משקל שמתאים למי שרוצה לשנות זהות דובר בקובץ קיים.

  • 592 MBמשקל הקבצים
  • 1,740הורדות בחודש
  • 113לייקים

מה זה

מדובר בגרסה ייעודית של SpeechT5 שעברה התאמה למשימת voice conversion ישירות מאודיו לאודיו. הארכיטקטורה מבוססת על אנקודר ודקודר משותפים עם רשתות עיבוד ייעודיות לדיבור, כשהרעיון הוא לטפל ברצף האודיו באופן ישיר. המודל שוקל 592 מגה בייט, כך שהוא קטן משמעותית ממערכות כבדות ומודרניות יותר בתחום השמע.

האימון הספציפי נעשה על בסיס הנתונים CMU ARCTIC, שמכיל הקלטות נקיות של דוברים באנגלית. הוא לא מייצר דיבור חדש מאפס ולא מתמלל, אלא לוקח גל קול של 16 קילוהרץ מונאו וממיר אותו למאפייני קול אחרים לפי הנתונים שעליהם כויל.

מתאים ל

  • שינוי קול בהקלטות

    המרת גל קול מקורי מקובץ שמע לזהות דובר חלופית ישירות מאודיו.

  • עיבוד מקומי ופרטי

    משקל קל של 592 מגה בייט שמאפשר ריצה על מחשב אישי ללא שליחת מידע החוצה.

  • בדיקות אוטומציה לקול

    יצירת דגימות קול מגוונות מתוך קובץ מקור יחיד לצורכי בדיקת מערכות שמע.

איפה זה נופל

צוות המפתחים המקורי לא סיפק כרטיס מודל מלא, והמידע נכתב על ידי האגינג פייס. האימון בוצע על מאגר CMU ARCTIC באנגלית, כך שאין שום הבטחה או עדות לכך שהוא מתמודד עם עברית, מבטאים שונים או רעשי רקע. בנוסף, הוא מוגבל לאודיו מונו ב־16 קילוהרץ בלבד ומחייב התאמה מראש של הקלט.

שאלות
נפוצות

האם אפשר לתת לו טקסט כדי שיקריא אותו בקול של מישהו אחר?

לא, הגרסה הזו מיועדת ספציפית למשימת audio-to-audio. כדי לקחת טקסט ולהפוך אותו לדיבור יש גרסאות אחרות של המשפחה הזו, בעוד שכאן חייבים לספק קובץ קול בתור קלט.

האם הוא יעבוד כמו שצריך עם הקלטות בעברית?

אין לכך תיעוד בכרטיס, והכיול בוצע על מאגר CMU ARCTIC שמכיל אנגלית בלבד. יש סיכוי גבוה שהתוצאה בעברית תהיה משובשת, ולכן צריך לבדוק אותו עצמאית לפני שמתכננים עליו למשהו מעבר לאנגלית.

איך מריצים

טוענים אותו דרך ספריית transformers בפייתון באמצעות SpeechT5ForSpeechToSpeech, כשהקלט חייב להיות אודיו מונו שנדגם ב־16 קילוהרץ. המשקל הכולל יושב על פחות מגיגה בייט אחד, לכן כרטיס מסך בסיסי או מעבד מודרני מריצים אותו בלי בעיה ובלי צורך בתשתית מיוחדת.

אם אתם צריכים תמיכה רחבה בשפות, ריבוי דוברים מורכב או איכות שידור גבוהה, כנראה שעדיף לשלם ל־API חיצוני ייעודי. הפתרון הזה מתאים למי שרוצה הרצה מקומית, פרטית ובחינם בלי תלות ברשת.

from transformers import pipeline

pipe = pipeline("audio-to-audio", model="microsoft/speecht5_vc")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗