GPT
Q

Qwen3-TTS-12Hz-0.6B-CustomVoice

קוד פתוח

Qwenapache-2.02026-01-21

  • safetensors
  • qwen3_tts
  • tts
  • qwen
  • audio

יש כאן גם סקירה על Qwen עצמו.

מודל דיבור קטן שמאפשר לכוון טונציה ורגש בעזרת הוראות טקסט רגילות. הוא מייצר אודיו בהשהיה נמוכה במיוחד ומתאים להטמעה מקומית בלי צורך בשרתי ענק.

  • 906Mפרמטרים
  • 2.3 GBמשקל הקבצים
  • 1,065,889הורדות בחודש
  • 184לייקים

מה זה

מדובר במודל טקסט לדיבור שכולל כ־906 מיליון פרמטרים ומבוסס על טוקנייזר של 12Hz. הנקודה המרכזית כאן היא היכולת לשלוט בסגנון ההקראה. במקום להסתפק בהקראה יבשה, אתם מעבירים לו הנחיה בטקסט חופשי, כמו לבקש לדבר בכעס או בשמחה, והוא מתאים את הקצב, הרגש והטון בהתאם.

הוא מגיע עם תשעה קולות מוגדרים מראש שתומכים בשפות שונות, וכולל אופטימיזציה להזרמת אודיו בזמן אמת. לפי הנתונים הטכניים, הוא מגיע להשהיה של 97 מילישניות מקצה לקצה. בפועל זה אומר שאפשר לחבר אותו לממשקי שיחה קולית בלי שהמשתמש ירגיש שתיקה מעיקה עד שהמשפט הראשון מתחיל להתנגן.

מתאים ל

  • עוזר קולי באנגלית

    זמן תגובה של 97 מילישניות מתאים במיוחד לשיחות שדורשות מענה מיידי בלי עיכובים מורגשים.

  • דיבוב משחקים לפי מצב רוח

    היכולת להזין הוראת רגש בטקסט מאפשרת לשנות את הטון של הדמות בהתאם להתרחשות בסצנה.

  • הקראת תוכן בשפות אסייתיות

    הקולות המובנים מותאמים היטב לסינית, יפנית וקוריאנית, ומספקים דיבור טבעי בשפות אלו.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי ברור מיד: עברית פשוט לא קיימת כאן. המודל תומך בעשר שפות כמו אנגלית, סינית, יפנית, גרמנית וצרפתית, אבל אין לו שום תמיכה בשפות שמיות. אם תנסו לתת לו טקסט בעברית, זה לא יעבוד.

בנוסף, מבחר הקולות המובנה מוגבל לתשעה בלבד, כשרובם בכלל מיועדים למנדרינית ורק שניים לאנגלית. המפתחים מדגישים שהתוצאה הטובה ביותר מתקבלת כשמשתמשים בקול בשפת המקור שלו, כך שטווח התמרון שלכם עם דמויות באנגלית או באירופאיות מצומצם למדי.

שאלות
נפוצות

האם המודל תומך בייצור דיבור בעברית?

לא. רשימת השפות הנתמכות כוללת סינית, אנגלית, יפנית, קוריאנית, גרמנית, צרפתית, רוסית, פורטוגזית, ספרדית ואיטלקית. אין תמיכה בעברית והוא לא מתאים לטקסט מקומי.

איך שולטים על הרגש של הקול בזמן הפקת הדיבור?

מעבירים פרמטר טקסטואלי עם הנחיה ישירה לקריאה, למשל בקשה לטון כועס או שמח. המודל מנתח את ההוראה ומיישם את שינויי הטמפו והטונציה על קובץ האודיו שנוצר.

איך מריצים

המשקל הכולל של הקבצים הוא 2.3 גיגה בייט, כך שמדובר במודל קל מאוד להורדה ולהרצה. כדי להריץ אותו צריך כרטיס מסך עם תמיכה ב־bfloat16 ומומלץ להשתמש ב־Flash Attention 2 כדי לנצל את המהירות שלו. כל כרטיס מודרני סביר עם 6 עד 8 גיגה זיכרון וידאו יחזיק אותו בלי בעיה מקומית דרך חבילת הפייתון הייעודית שלו.

אם אתם צריכים רק הקראה בודדת מדי פעם, להרים שרת ייעודי עבורו זה בזבוז משאבים ועדיף לפנות לפתרונות ענן מוכנים. לעומת זאת, אם אתם מפתחים בוט קולי שדורש תגובה מיידית והזרמה רציפה, שווה להריץ אותו ישירות על הברזל שלכם.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-12Hz-0.6B-CustomVoice

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק מתוכנה סגורה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗