GPT
Q

Qwen3-TTS-Tokenizer-12Hz

קוד פתוח

Qwenapache-2.02026-01-21

  • safetensors
  • qwen3_tts_tokenizer_12hz
  • audio
  • tts
  • speech

יש כאן גם סקירה על Qwen עצמו.

זה מקודד שדוחס קול לטוקנים בקצב נמוך של 12.5 הרץ ומחזיר אותם לסאונד. הוא מתאים למי שבונה מודלי שפה אודיו או צריך להזרים קול בזמן אמת ובלייטנסי נמוך במיוחד.

  • 171Mפרמטרים
  • 651 MBמשקל הקבצים
  • 220,618הורדות בחודש
  • 87לייקים

מה זה

מדובר ברכיב שממיר אודיו לרצף טוקנים בדידים (קודים) ובחזרה לגל קול, עם 171 מיליון פרמטרים בלבד. הוא מבוסס על רשת קונבולוציה סיבתית (causal ConvNet) עם 16 שכבות של ספריות קודים (multi-codebook), ועובד בקצב של 12.5 הרץ. המבנה הזה נועד לדחיסה אקוסטית תוך שימור מידע פראלינגוויסטי ותכונות של סביבת ההקלטה.

הייחוד שלו הוא דחיפה ללייטנסי אפסי בהזרמה. במקום לחכות למקטעי קול ארוכים כדי לקודד, הארכיטקטורה הסיבתית פולטת חבילות מידע מיד. הוא חלק ממשפחת המודלים שתומכת בעשר שפות: סינית, אנגלית, יפנית, קוריאנית, גרמנית, צרפתית, רוסית, פורטוגזית, ספרדית ואיטלקית.

מתאים ל

  • אימון מודלי אודיו

    ייצוג סאונד כטוקנים בדידים בקצב נמוך במיוחד של 12.5 הרץ עבור מודלי שפה.

  • הזרמת קול בזמן אמת

    קידוד ופענוח קול מיידיים בלייטנסי נמוך בזכות ארכיטקטורת ConvNet סיבתית.

  • דחיסת קול להעברה

    צמצום נפח תעבורת אודיו ברשת באמצעות דחיסה אקוסטית יעילה של 16 ספריות קוד.

איפה זה נופל

זה רק טוקנייזר ולא מערכת טקסט לדיבור שלמה. אי אפשר לתת לו טקסט ולקבל קול, אלא רק להמיר קול קיים לטוקנים ובחזרה. בנוסף, עברית לא מופיעה ברשימת עשר השפות הנתמכות שהוגדרו עבור הפרויקט, כך שאיכות הקידוד והשחזור של דיבור בעברית לא מובטחת ודורשת בדיקה עצמאית לפני שנשענים עליו.

שאלות
נפוצות

האם המודל הזה יודע להקריא טקסט בקול?

לא. זה טוקנייזר בלבד, שמקבל קול, הופך אותו למספרים ומחזיר אותם לסאונד. כדי לייצר דיבור מטקסט צריך מודל TTS שלם שמייצר את הטוקנים האלה.

האם הוא תומך בעברית?

עברית אינה מופיעה בעשר השפות שהיצרן מציין במפורש. מכיוון שמדובר בקידוד אקוסטי ייתכן שהוא ישחזר את הצלילים היטב, אבל צריך לבדוק את איכות הפלט לפני שמשלבים אותו במערכת.

איך מריצים

מתקינים את חבילת qwen-tts ומריצים ישירות בפייתון עם פקודות encode ו־decode פשוטות מעל soundfile. הקבצים שוקלים 651 מגה-בייט בלבד, כך שכל כרטיס מסך בסיסי עם מעט מאוד זיכרון יחזיק אותו בלי להתאמץ, ואפשר להריץ אותו מקומית אפילו על לפטופ פיתוח בלי לחשוב פעמיים.

אין שום סיבה לשלם על API חיצוני בשביל רכיב בגודל כזה. הוא קטן, מהיר ומיועד בדיוק לרוץ כחלק מהתשתית המקומית שלכם ליד מודל השפה.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-Tokenizer-12Hz

הקבצים

6 קבצים במאגר, 651 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗