GPT
C

chatterbox-turbo-demo

רץ בדפדפן

ResembleAImit2025-12-05

  • gradio
  • mcp-server

יש כאן גם סקירה על Resemble AI עצמו.

הדגמת רשת שממירה טקסט לדיבור בקול מותאם אישית לפי קובץ שמע. מתאימה למי שרוצה לבדוק את מהירות ויכולות מודל הטורבו ישירות בדפדפן.

  • הורדות בחודש
  • 529לייקים

מה זה

מזינים טקסט לתיבה, מעלים קובץ שמע של קול לייחוס ומקבלים קובץ קול חדש שמקריא את מה שכתבתם באותו הסגנון. הממשק כולל כפתורי תגיות לבחירה מהירה, ותיבת סימון שמופעלת כברירת מחדל לאיזון עוצמת השמע למינוס 27 LUFS.

מאחורי הקלעים רץ המודל ChatterboxTurboTTS בטעינה ישירה לכרטיס מסך. יחד איתו מוגדרים במערכת גם chatterbox הרגיל וגם gpt2 הוותיק. למי שרוצה לשלוט בתוצאה, יש הגדרות מתקדמות לכוונון המדגם כמו טמפרטורה, top-p, top-k, ענישה על חזרתיות וקביעת סיד אקראי לשחזור מדויק של תוצאות.

מתאים ל

  • שכפול קול מהיר

    יצירת קטעי דיבור בקול מוגדר מראש על ידי העלאת דגימה קצרה.

  • בדיקת פרמטרים למודל

    משחק עם טמפרטורה וענישת חזרתיות כדי לראות איך המודל מגיב.

  • הפקת שמע מקוונת

    המרה נקודתית של משפטים לקובץ שמע מנורמל ישירות מהדפדפן.

איפה זה נופל

ההדגמה לא חושפת תמיכה מפורשת בשפות שאינן אנגלית, ולכן טקסט בעברית כנראה ייכשל או יישמע משובש לחלוטין. בנוסף, מודלים של טורבו לעיתים מקריבים איכות הגייה או יציבות לטובת מהירות, וקובץ ייחוס באיכות נמוכה ייצר תוצאה צורמת. אל תבנו על זה לפרויקט מסחרי רחב לפני שבדקתם איך המודל מתמודד עם טקסטים ארוכים.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, ההדגמה פתוחה לשימוש חופשי בדפדפן ללא תשלום. כל עוד השרת זמין ומקצה את החומרה הנדרשת, אפשר להריץ טקסטים בלי להזין פרטי אשראי. יחד עם זאת, מדובר בסביבה שיתופית ולכן ייתכנו הגבלות זמן שימוש רציף.

מה קורה עם קובצי השמע שמעלים לכאן?

הקבצים מעובדים על גבי השרת שמריץ את האפליקציה כדי לייצר את הדיבור החדש. מאחר שמדובר בהדגמה ציבורית ברשת, המידע עובר דרך שרתי צד שלישי. עדיף לא להעלות הקלטות קול אישיות או חומרים מסחריים מוגנים.

אפשר להריץ את המערכת הזו על מחשב אישי?

כן, הרישיון הוא MIT והקוד מבוסס על ספריית פייתון ומודלים שזמינים להורדה. תצטרכו מחשב עם כרטיס מסך תומך של אנבידיה כדי להריץ את גרסת הטורבו בקצב סביר. ללא מעבד גרפי מתאים, הביצועים יהיו אטיים מאוד.

במה שונה הדמו הזה מהרצה של המודל בקוד?

הממשק הגרפי מספק דרך מהירה לראות תוצאות בלי לכתוב שורת קוד אחת. מצד שני, הוא מוגבל לטקסט בודד בכל פעם ולא מאפשר עיבוד אצווה או חיבור לאוטומציות. מי שצריך לשלב את הקול במערכת חיצונית יצטרך לפנות ישירות למודל עצמו.

איך משתמשים

לוחצים על כפתור Generate וממתינים. ההדגמה רצה על גבי מאיץ zero-a10g שמספק כוח עיבוד של אנבידיה לפי דרישה. זה אומר שאם המאיץ במצב שינה תיתכן המתנה קצרה להקצאה, אבל ברגע שהוא פעיל ההפקה מהירה מאוד. אין צורך בהתקנה מקומית כדי לנסות.

הרישיון

הקוד מופץ תחת רישיון MIT המתירני. מותר להשתמש, לשנות ולשלב בפרויקטים פרטיים ומסחריים. לגבי קובצי השמע שאתם מעלים ומפיקים, הם עוברים דרך השרת המארח של הדמו ולכן לא מומלץ להעלות לשם הקלטות רגישות או פרטיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗