GPT
Q

Qwen3-TTS-12Hz-1.7B-CustomVoice

קוד פתוח

Qwenapache-2.02026-01-21

  • safetensors
  • qwen3_tts
  • text-to-speech

יש כאן גם סקירה על Qwen עצמו.

הפקת דיבור עם שליטה בטון וסגנון דרך הנחיות טקסטואליות, המיועדת לתשעה קולות מוגדרים מראש. זמן התגובה להזרמת חבילת האודיו הראשונה מגיע ל־97 מילישניות.

  • 1.9Bפרמטרים
  • 4.2 GBמשקל הקבצים
  • 2,592,396הורדות בחודש
  • 1,955לייקים

מה זה

המודל מבצע המרה של טקסט לדיבור בעשר שפות: סינית, אנגלית, יפנית, קוריאנית, גרמנית, צרפתית, רוסית, פורטוגזית, ספרדית ואיטלקית. הוא מבוסס על ארכיטקטורת discrete multi-codebook LM יחד עם טוקנייזר ייעודי של 12Hz, מבנה שעוקף את מודלי ה־DiT הרגילים ומספק שחזור אודיו בקצב מהיר. הוא מתמודד עם קלט רועש ומתאים אינטונציה וקצב דיבור בהתאם להקשר הטקסט.

בגרסת ה־CustomVoice הזו, אתם לא יכולים לשבט קול חדש מקובץ אודיו או להמציא פרסונה חופשית, אלא מקבלים גישה לתשעה דוברים מובנים. המודל שולט בגוון, ברגש ובפרוזודיה של הדוברים האלה באמצעות הוראות טקסט (instruct), ומייצר אודיו בהזרמה ישירה מהתו הראשון.

מתאים ל

  • עוזרים קוליים בזמן אמת

    זמן תגובה של 97 מילישניות לחבילה ראשונה מאפשר תגובה מיידית בשיחה באנגלית או שפות נתמכות.

  • הקראת תוכן מותאמת רגש

    שליטה בפרוזודיה ובקצב דרך הנחיית טקסט עבור תשעת הקולות המובנים בלי לאמן מודל מחדש.

  • משחקים ודמויות וירטואליות

    שימוש בתשעה פרופילי דיבור מוגדרים מראש והתאמת הטון לסצנה באמצעות פקודות בשפה טבעית.

איפה זה נופל

אין כאן תמיכה בעברית. רשימת השפות כוללת עשר שפות בלבד, כך שעבור טקסט מקומי תצטרכו לחפש פתרון אחר לגמרי. בנוסף, חלוקת הדוברים לא מאוזנת: מתוך תשעת הקולות המובנים, חמישה הם דוברי סינית, שניים דוברי אנגלית, אחת יפנית ואחת קוריאנית. לגרמנית, צרפתית או ספרדית אין דובר מקורי ייעודי. מעבר לזה, הדגם הזה מוגבל לתשעת הקולות בלבד, ולצורך שכפול קול מקובץ אודיו של 3 שניות תצטרכו להוריד את דגם ה־Base.

שאלות
נפוצות

האם המודל מסוגל לקרוא טקסט בעברית?

לא. המודל תומך רשמית בעשר שפות בלבד: אנגלית, סינית, יפנית, קוריאנית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית ורוסית. טקסט בעברית אינו נתמך.

אפשר להעלות קובץ הקלטה ולשכפל קול עם הדגם הזה?

לא עם הקובץ הזה. גרסת CustomVoice מוגבלת לתשעת הקולות המובנים שלה, וכדי לשכפל קול מדגימה של 3 שניות עליכם להוריד את גרסת ה־Base.

אפשר להריץ אותו על שרת ללא כרטיס מסך של אנבידיה?

התיעוד דורש שימוש ב־FlashAttention 2 וטעינה ב־bfloat16 או float16, מה שמחייב מעבד גרפי תואם. ללא כרטיס מתאים תצטרכו להשתמש ב־API של DashScope.

איך מריצים

ההפעלה המקומית דורשת כרטיס מסך תומך FlashAttention 2 וטעינה בפורמט bfloat16 או float16, כאשר הקבצים שוקלים כ־4.2GB. כדי להתקין אותו צריך סביבת פייתון 3.12 ואת החבילה qwen-tts, או להריץ דרך vLLM-Omni שתומך כרגע רק בהסקה אופליין.

גרסת ה־1.7B כבדה יותר מגרסת ה־0.6B אבל היא היחידה מבין דגמי ה־CustomVoice שתומכת בשליטה מבוססת הנחיות. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו, יש לחברה שירות ענן DashScope שמציע API להזרמה בזמן אמת.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

הרישיון

הקוד והמשקלים מופצים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, להריץ אותו במוצר שלכם, לשנות אותו ולהפיץ אותו הלאה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗