GPT
Q

Qwen3-TTS-12Hz-1.7B-VoiceDesign

קוד פתוח

Qwenapache-2.02026-01-21

  • qwen-tts
  • safetensors
  • qwen3_tts
  • audio
  • tts

יש כאן גם סקירה על Qwen עצמו.

מודל דיבור שמייצר קולות מותאמים אישית והוראות בשפה טבעית. הוא מתאים למי שרוצה שליטה בפרוזודיה ורגש בלי להחזיק שרתים כבדים.

  • 1.9Bפרמטרים
  • 4.2 GBמשקל הקבצים
  • 293,501הורדות בחודש
  • 405לייקים

מה זה

המודל הזה ממיר טקסט לקול בגודל של 1.9 מיליארד פרמטרים, כשהייחוד בגרסת VoiceDesign הוא היכולת לכוון סגנון וגוון קול באמצעות הנחיות טקסטואליות פשוטות. הוא מתבסס על טוקנייזר של 12Hz וארכיטקטורת שפה מרובת ספריות קודים בדידות, מה שמסייע לדחיסה אקוסטית יעילה.

בבדיקות Zero-shot על ערכת Seed-TTS, גרסת הבסיס שלו הציגה שיעור שגיאות מילים של 0.77 בסינית ו־1.24 באנגלית. המשמעות בשטח היא רמת דיוק גבוהה בהגייה ובהבנת הטקסט, ללא עיוותים קריטיים במילים הנאמרות בשפות הנתמכות.

הוא כולל תמיכה בהזרמה עם שיהוי מקצה לקצה של החל מ־97 מילישניות, ותומך בעשר שפות מרכזיות כמו אנגלית, סינית, ספרדית וצרפתית לצד פרופילי ניבים שונים.

מתאים ל

  • עוזרי שמע וממשקי שיחה

    שיהוי של 97 מילישניות בהזרמה מתאים לתשובות מהירות בלי שהמשתמש יחכה.

  • דיבוב דמויות במשחקים

    הנחיות טקסט מגדירות רגש ואופי דיבור שונה לכל דמות ישירות מהקוד.

  • קריינות תוכן רב לשוני

    הפקה מהירה בעשר שפות גדולות עם שמירה על קול אחיד ורמת שגיאות נמוכה.

איפה זה נופל

המודל לא כולל תמיכה בעברית. רשימת עשר השפות מכסה שפות נפוצות כמו אנגלית, רוסית או גרמנית, כך שלפרויקטים מקומיים דוברי עברית הוא אינו רלוונטי ללא אימון נוסף. מעבר לזה, תוצאות המדידה שפורסמו מתייחסות רק לאנגלית וסינית, ואין נתונים על שאר השפות הנתמכות בכרטיס.

שאלות
נפוצות

האם המודל יודע לדבר עברית?

לא. המודל תומך בעשר שפות ספציפיות שפורטו במפרט, ועברית אינה מופיעה ביניהן. הרצה שלו על טקסט עברי פשוט לא תפיק תוצאה שמישה.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו?

קבצי המודל תופסים 4.2 גיגה-בייט בסך הכול. כרטיס מסך עם 8 גיגה זיכרון ותמיכה ב־bfloat16 יספיק להרצה מקומית, אם כי לביצועי הזרמה מיטביים עדיף כרטיס חזק יותר שתומך ב־flash_attention_2.

איך מריצים

כדי להריץ אותו מתקינים את חבילת qwen-tts בפייתון וטוענים אותו לכרטיס מסך בפורמט bfloat16 עם flash_attention_2. משקל הקבצים עומד על 4.2 גיגה-בייט, כך שהוא נכנס בקלות לכרטיס מסך ביתי מודרני עם 8 עד 12 גיגה זיכרון גרפי, בלי צורך במערך שרתים יקר.

אם אתם צריכים רק שירות בסיסי בלי שליטה עדינה בהוראות קול ואין לכם כרטיס מתאים עם תמיכת קודה, פנייה ל־API מוכן תחסוך את התחזוקה. אבל כשנדרשת השהיה של 97 מילישניות או סגנון דיבור מותאם אישית, הרצה מקומית תיתן את המענה הנכון.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign

הרישיון

הפרויקט מופץ ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך המוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ותנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗