GPT
C

CapSpeech-TTS

רץ בדפדפן

OpenSoundcc-by-nc-4.02025-06-05

  • gradio

הופכת טקסט לדיבור מותאם אישית לפי תיאור מילולי של סגנון, מבטא ורגש. מתאימה ליוצרים ומפתחים שרוצים לבדוק שליטה קולית בלי להקליט דוגמאות מראש.

  • הורדות בחודש
  • 100לייקים

מה זה

אתם כותבים משפט להקראה ומוסיפים תיאור טקסטואלי חופשי שמגדיר איך הקול יישמע. אפשר לבקש דיבור שמח, מבטא מסוים או סגנון כללי, ובלחיצת כפתור המערכת מייצרת קובץ שמע ישירות בדפדפן. הממשק מחולק לשלוש לשוניות ייעודיות: אחת לסגנון כללי, שנייה שמכוונת למבטאים, ושלישית שמתמקדת בהבעת רגשות, ובכל אחת מהן מובנות דוגמאות מוכנות שמשלבות תיאור סגנון עם טקסט.

מאחורי הקלעים רצה שרשרת מודלים שמבוססת על טכניקת Flow Matching ויצירת שמע באמצעות BigVGAN. לצד מנוע הדיבור, נטענים רכיבים נוספים ממשפחות Whisper, WavLM, Flan T5 ו־CLAP, שמשמשים לעיבוד הטקסט, הבנת התיאור הקולי והמרת הייצוגים לצליל הסופי.

מתאים ל

  • דיבוב דמויות לפי אופי

    יצירת קולות מגוונים למשחקים או אנימציה על ידי הגדרת גיל, מבטא ומצב רוח ישירות בתיאור.

  • בדיקת אבטיפוס לסאונד

    בחינה מהירה של שורות תסריט באורכים קצרים לפני שמזמינים קריינים לאולפן הקלטות.

  • מחקר בתחום דיבור מונחה טקסט

    בדיקת היכולת של מודלי Flow Matching לעקוב אחרי הנחיות סגנון מילוליות מורכבות.

איפה זה נופל

ההדגמה מוגבלת לייצור קטעים של עד 20 שניות בכל הרצה, כך שהיא לא מתאימה להקראת פסקאות ארוכות או ספרים שלמים. בנוסף, כל המודלים והדאטהסטים שעליהם היא נשענת בנויים סביב אנגלית, כך שאין כאן תמיכה בעברית או במבטאים מקומיים. מומלץ לבדוק אם תיאור הסגנון שלכם באמת משפיע על התוצאה, שכן מודלים מבוססי טקסט לסגנון נוטים לפעמים להתעלם מהנחיות מורכבות מדי.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה דרך הדפדפן היא חינמית לחלוטין ואינה דורשת תשלום. כל עוד השרת השיתופי זמין, אפשר להריץ דוגמאות בלי להזין כרטיס אשראי.

כמה זמן לוקח לכל קטע להיווצר?

הזמן תלוי במצב השרת ובמספר צעדי הרינדור שהגדרתם. מאחר שהאפליקציה נמצאת במצב שינה, ההפעלה הראשונה דורשת המתנה של דקה או שתיים להתעוררות החומרה, ולאחר מכן היצירה נמשכת מספר שניות לכל משפט.

מה קורה לטקסטים שאני מזין בממשק?

הטקסטים שאתם מקלידים מעובדים ישירות על גבי התשתית שמריצה את הממשק. אין הצהרה על שמירת המידע במאגר פרטי, אך מדובר בסביבה ציבורית ולכן לא כדאי להזין בה מידע רגיש או סודי.

האם אפשר להריץ את הכלי על המחשב האישי?

הקוד זמין להורדה אך דורש כרטיס מסך חזק עם זיכרון ייעודי בנפח משמעותי כדי לטעון את כל רכיבי המערכת. התקנה מקומית תדרוש ידע בפייתון וסביבת עבודה מתאימה.

איך משתמשים

בוחרים את הלשונית המתאימה, מקלידים את תיאור הקול ואת הטקסט להקראה, ולוחצים על Generate. אם רוצים לדייק את התוצאה, אפשר לפתוח תפריטי הגדרות ולשנות את מהירות הדיבור, להגביל את האורך עד 20 שניות, או לשחק עם פרמטרי ה־Flow Matching כמו מספר הצעדים וערך ה־CFG.

האפליקציה יושבת על תשתית Zero A10G שמופעלת לפי דרישה, אבל כרגע היא במצב שינה. כשתיכנסו אליה ייקח לה זמן להתעורר, לטעון את כל המשקלים של המודלים לזיכרון ורק אז להתחיל לעבד את הבקשה.

הרישיון

הקוד והמודלים מופצים תחת רישיון cc-by-nc-4.0. המשמעות היא שהשימוש מותר למטרות מחקר, בדיקות ושימוש אישי בלבד, ואסור לשלב את התוצרים או את המערכת בפרויקטים מסחריים מניבי רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗