GPT
Q

Qwen3-TTS-12Hz-1.7B-Base

קוד פתוח

Qwenapache-2.02026-01-21

  • safetensors
  • qwen3_tts

יש כאן גם סקירה על Qwen עצמו.

מודל הקראת טקסט ושיבוט קול שמפיק שמע בהזרמה בזמן תגובה של 97 מילישניות. הוא משכפל דובר מתוך הקלטה של שלוש שניות בלבד בעשר שפות נתמכות.

  • 1.9Bפרמטרים
  • 4.2 GBמשקל הקבצים
  • 3,558,093הורדות בחודש
  • 509לייקים

מה זה

המודל כולל כמעט 1.93 מיליארד פרמטרים ומתבסס על ארכיטקטורת מודל שפה בדיד מרובה קודבוקים, ללא רכיבי דיפוזיה מהסוג המקובל. הדחיסה האקוסטית נעשית באמצעות טוקנייזר ייעודי של 12 הרץ שמסוגל לייצר חבילת שמע ראשונה מיד עם הזנת תו בודד. בעזרת מבנה הזרמה דו ערוצי, הוא מאפשר עבודה שוטפת בזמן אמת.

גרסת ה־Base הזו מיועדת לשיבוט קול ולבסיס לאימון נוסף. היא דורשת דגימת קול של שלוש שניות יחד עם התמלול המדויק שלה כדי לשחזר את גוון הדיבור, ומכסה עשר שפות, ביניהן אנגלית, סינית, צרפתית, ספרדית ורוסית. תוצאות מדידת שיעור שגיאות המילים במבחן סיד מציגות דיוק תמלול גבוה על שפות המקור בהשוואה למודלים פתוחים אחרים.

מתאים ל

  • שיבוט קול מהיר

    הוא משחזר דובר מקובץ שמע של שלוש שניות בלבד, ומאפשר שימוש חוזר באותו פרומפט לחסכון בזמן חישוב.

  • מערכות דיבור בזמן אמת

    עם זמן תגובה של 97 מילישניות לחבילת השמע הראשונה, הוא מתאים לחיבור מול ממשקים קוליים אינטראקטיביים.

  • בסיס לכוונון מודלים

    הארכיטקטורה מותאמת לאימון המשך וכוונון על קולות או ניבים ספציפיים בעשר השפות הנתמכות.

איפה זה נופל

עברית לא נתמכת כאן כלל, כך שאי אפשר להשתמש בו לטקסט מקומי בלי אימון ייעודי מאפס. בנוסף, גרסת הבסיס אינה כוללת שליטה בהנחיות טקסטואליות על רגש או אינטונציה, תכונה שקיימת רק בגרסאות ה־CustomVoice וה־VoiceDesign. שיבוט קול ללא תמלול מדויק פוגע משמעותית באיכות השמע, וכרגע אין תמיכה מלאה בהגשת שרת חי אונליין דרך vLLM.

אותה משפחה

Qwen3-TTS-12Hz יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ליצירת קולות בעברית?

לא. החומר הרשמי מפרט תמיכה בעשר שפות בלבד, ביניהן אנגלית, סינית, ספרדית ורוסית. טקסט בעברית לא יעבוד בצורה תקינה ללא אימון נוסף נרחב.

מה ההבדל בינו לבין דגמי ה־CustomVoice של אותה סדרה?

דגם הבסיס דורש דגימת אודיו חיצונית של שלוש שניות כדי לשכפל קול, ואין לו יכולת מובנית להגיב להנחיות טקסט חופשיות לגבי סגנון הדיבור. גרסאות הקול המותאם מכילות קולות מובנים מראש עם יכולת שליטה בסגנון דרך פרומפט.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.2 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון מריץ אותו ללא קושי. רצוי להפעיל FlashAttention 2 כדי לחסוך זיכרון ולהאיץ את ההסקה, ומערכת ההפעלה דורשת סביבת פייתון 3.12 עם חבילת qwen-tts הייעודית.

קיימת תמיכה ראשונית בהרצה מקומית דרך vLLM-Omni אך היא מוגבלת כרגע לעבודה לא מקוונת. אם אתם צריכים שירות רשת חי בפרודקשן בעומס כבד ואין לכם שרתי GPU זמינים, אפשר להשתמש ב־API המנוהל של DashScope במקום לנהל את התשתית בעצמכם.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-12Hz-1.7B-Base

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗