GPT
Q

Qwen3-TTS

רץ בדפדפן

Qwenapache-2.02026-01-21

  • gradio

יש כאן גם סקירה על Qwen עצמו.

הופכים טקסט כתוב לדיבור, מעצבים קולות חדשים לפי תיאור מילולי או משכפלים קול מהקלטה קיימת. מיועד למי שרוצה לבדוק את יכולות הדיבור של משפחת המודלים הזו בדפדפן בלי לכתוב שורת קוד אחת.

  • הורדות בחודש
  • 2,222לייקים

מה זה

מזינים טקסט ומקבלים קובץ שמע ישירות בנגן. הממשק מחולק לשלוש לשוניות עבודה שונות, שכל אחת מהן מפעילה מודל ייעודי מהסדרה. בלשונית הראשונה מתארים במילים את גוון הקול הרצוי, למשל גיל או סגנון, והיא מייצרת קול מותאם. הלשונית השנייה מאפשרת להעלות הקלטת שמע קצרה וטקסט תואם כדי לשכפל את הקול ולגרום לו להקריא משפט חדש לחלוטין. הלשונית השלישית מציעה דוברים מוגדרים מראש עם אפשרות לתת הנחיות סגנון.

מאחורי הקלעים רצות גרסאות של 1.7B ו־0.6B של המודלים ממשפחת Qwen3-TTS בקצב 12Hz, כולל דגמי Base, CustomVoice ו־VoiceDesign. הקוד טוען את המודלים מראש ומאפשר לבחור בין גדלי המודל בלשוניות השכפול והדיבור המובנה, כדי לאזן בין איכות לזמן יצירה.

מתאים ל

  • שכפול קול אישי

    מעלים דגימת קול קצרה ומפיקים ממנה הקראת טקסטים חדשים בלי להקליט מחדש.

  • עיצוב דמויות מותאמות

    מגדירים בטקסט אופי, גיל או טון דיבור ליצירת קריינות שמתאימה לפודקאסט או משחק.

  • הקראת טקסט מובנית

    בוחרים דובר קיים מתוך הרשימה ומפיקים קבצי דיבור מהירים מכל טקסט שרוצים.

איפה זה נופל

המודל דורש תיאור קולי מפורש בלשונית העיצוב, ואם תשאירו את השדה ריק תקבלו הודעת שגיאה מידית. שכפול קול איכותי תלוי מאוד בהזנה מדויקת של הטקסט התואם להקלטה שהעליתם, ובלעדיו התוצאה עלולה להשתבש. בנוסף, מדובר בהדגמה מבוססת שרת שיתופי, כך שקטעי טקסט ארוכים במיוחד עלולים להיתקל במגבלות זמן ריצה של סביבת spaces.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה בדפדפן חופשית לחלוטין. אין צורך להזין אמצעי תשלום ואין דרישת התחברות לחשבון.

כמה זמן לוקח לייצר קובץ שמע?

העיבוד נשען על חומרת A10G ייעודית, כך שייצור קטע קצר לוקח בדרך כלל שניות בודדות. אם השרת היה במצב שינה, ייתכן עיכוב קל בהפעלה הראשונה.

מה קורה עם קבצי הקול שאני מעלה?

הקבצים מועברים ישירות לשרת שמריץ את הדגמת ה־Gradio כדי לעבד את השמע. לא מומלץ להעלות הקלטות רגישות או פרטיות לשרתים ציבוריים כאלה.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד כתוב בפייתון עם Gradio וספריית qwen_tts תחת רישיון apache-2.0. אפשר להוריד את המודלים מ־Hugging Face ולהרים אותם על חומרה מתאימה.

איך משתמשים

בוחרים לשונית, מקלידים את הטקסט, מגדירים שפה, ולוחצים על כפתור ההפקה הראשי. אם משכפלים קול, מעלים קודם קובץ שמע ומקלידים מה נאמר בו, עם אפשרות לסמן שימוש ב־xvector בלבד. הממשק פתוח לשימוש ישיר בדפדפן ללא צורך בהתחברות או הרשמה. הביצוע רץ על גבי חומרת zero-a10g שמקצה מעבד גרפי של אנבידיה לפי דרישה, מה שאומר שהעיבוד עצמו זריז, אבל לפעמים צריך להמתין שניות בודדות כשהמערכת מתעוררת.

הרישיון

הקוד והמודלים מפורסמים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי, כולל שינוי, הפצה ושימוש מסחרי, בכפוף לשמירה על תנאי הרישיון ומתן קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗