GPT
O

Offical-Spark-TTS

רץ בדפדפן

Mobvoiapache-2.02025-03-04

  • gradio

הדגמה קולית שממירה טקסט לדיבור או משכפלת קול קיים לפי הקלטה. מתאימה למי שרוצה לבדוק מודל דיבור פתוח בלי להוריד משקלים למחשב.

  • הורדות בחודש
  • 228לייקים

מה זה

הממשק מחולק לשתי לשוניות ברורות. בלשונית הראשונה, Voice Clone, מעלים קובץ שמע או מקליטים קול ישירות דרך המיקרופון, מזינים את הטקסט שנאמר בהקלטה ואת הטקסט החדש שרוצים להפיק, והכלי מייצר קובץ אודיו חדש באותו גוון קול.

בלשונית השנייה, Voice Creation, לא צריך הקלטה מראש. בוחרים מגדר באמצעות כפתורי בחירה, מכוונים מחוונים של גובה קול ומהירות, מקלידים טקסט בחלון הייעודי ולוחצים על יצירה כדי לקבל קובץ שמע מותאם.

מתחת למכסה המנוע רץ המודל Spark-TTS-0.5B של SparkAudio ו־Mobvoi. מדובר במודל שפועל עם חבילת soundfile לעיבוד האודיו ומריץ קוד פייתון שמנהל את הדגימות והטוקנים ישירות בממשק gradio.

מתאים ל

  • שכפול קול מהקלטה

    מעלים קובץ קול קצר וטקסט תואם, ומפיקים משפטים חדשים שנשמעים באותו גוון.

  • יצירת קולות לפי מאפיינים

    מכוונים מגדר, גובה צליל ומהירות כדי להקריא טקסט בקול סינתטי מותאם.

  • בדיקת המודל 0.5B

    בוחנים את יכולות ההגייה ואיכות השמע של SparkAudio לפני שמורידים את המשקלים.

איפה זה נופל

הבעיה המיידית היא שהשרת מושהה לחלוטין ולכן אין אפשרות להפיק כרגע שמע חי בעמוד. מעבר לכך, אין בקוד שום עדות לתמיכה בעברית, ולכן ניסיון להזין טקסט מקומי כנראה ייכשל או יישמע משובש.

ההדגמה מוגבלת לשני מסלולים קשיחים בלבד, שיבוט או בחירה לפי מחוונים של גובה ומהירות. אי אפשר לשלוט ברגשות מורכבים או לערוך מקטעים ספציפיים מתוך האודיו שנוצר.

שאלות
נפוצות

האם הכלי עובד כרגע בדפדפן?

לא. המופע מוגדר כרגע במצב מושהה, ולכן אי אפשר ללחוץ על הכפתורים ולקבל שמע ישירות מהעמוד.

האם אפשר להריץ את זה על המחשב?

כן. הקוד משתמש במודל הפתוח SparkAudio/Spark-TTS-0.5B שזמין להורדה, וניתן להתקין אותו עצמאית דרך פייתון ו־gradio.

האם יש תמיכה בהקראת עברית?

החומרים והקוד של המודל לא מציינים תמיכה בשפה העברית. סביר מאוד שהתוצאה תהיה חוסר זיהוי או ג'יבריש בצליל.

מה קורה לקבצי הקול שאני מעלה?

ההקלטות נשלחות לעיבוד בשרת שמריץ את הממשק כדי לבצע את השיבוט. מאחר שמדובר בהדגמה ציבורית, עדיף לא להעלות הקלטות רגישות או פרטיות.

איך משתמשים

כרגע אי אפשר להשתמש בה בדפדפן כי המופע נמצא במצב מושהה. בעבודה רגילה נכנסים לדף, בוחרים באחת משתי הלשוניות, ממלאים את השדות ולוחצים על Generate או Create Voice.

ההגדרה של המופע היא על חומרת מעבד בסיסית, בלי מאיץ גרפי ייעודי. יצירת קול במודלים כאלה על מעבד לוקחת זמן, כך שאם הדף יחזור לפעילות, זמני ההמתנה לכל פלט אודיו יהיו איטיים יחסית.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד. עם זאת, יש לבדוק בנפרד את תנאי השימוש של משקלי המודל עצמם ואת זכויות היוצרים על הקלטות הקול שאתם מעלים לשכפול.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗