GPT
Q

Qwen3-TTS-12Hz-0.6B-Base

קוד פתוח

Qwenapache-2.02026-01-21

  • safetensors
  • qwen3_tts
  • audio
  • tts
  • voice-clone

יש כאן גם סקירה על Qwen עצמו.

מודל דיבור קטן שמסוגל לשכפל קול מקטע של שלוש שניות בלבד. הוא מתאים למי שרוצה לייצר אודיו מקומי בעשר שפות בלי להחזיק שרת יקר.

  • 915Mפרמטרים
  • 2.3 GBמשקל הקבצים
  • 620,198הורדות בחודש
  • 294לייקים

מה זה

מדובר במודל טקסט לדיבור שמבוסס על ארכיטקטורת שפה מקצה לקצה עם ייצוג קולי בדיד של 12 הרץ. הוא אומן על יותר מחמישה מיליון שעות דיבור, ולמרות השם שלו שמציין 0.6B, יש לו בפועל 915 מיליון פרמטרים. הגרסה הזו מתמקדת ביכולת שיבוט קול מהיר, כשכל מה שצריך כדי לחקות דובר זה דגימת אודיו של שלוש שניות והתמלול שלה.

המשקל שלו עומד על 2.3 גיגה בייט בלבד, מה שהופך אותו לאחד הכלים הקומפקטיים ביותר בתחום הדיבור הרב לשוני. המפתחים מדווחים על זמני תגובה של עד 97 מילישניות בהזרמה, נתון שהופך אותו לרלוונטי מאוד ליישומים אינטראקטיביים שדורשים תשובה מידית, בניגוד למודלים כבדים שמייצרים שיהוקים מורגשים לפני תחילת הדיבור.

מתאים ל

  • עוזרים קוליים בזמן אמת

    זמן תגובה של 97 מילישניות מאפשר לייצר שיחה שוטפת בלי השהיות מעיקות.

  • שיבוט קול מהיר למשחקים

    מאפשר לשכפל קולות של דמויות משלוש שניות הקלטה בלי להעמיס על החומרה.

  • הקראת תוכן בשפות זרות

    מייצר דיבור טבעי בעשר שפות מרכזיות ישירות מתוך קובצי טקסט.

איפה זה נופל

הבעיה המרכזית עבור מפתחים בארץ היא היעדר תמיכה בעברית. המודל תומך בעשר שפות בלבד, ביניהן אנגלית, סינית, צרפתית, רוסית וגרמנית, ולכן אי אפשר להשתמש בו למוצרים שמיועדים לשוק המקומי בלי אימון נוסף.

בנוסף, מדובר בגרסת בסיס שמחייבת אתכם להחזיק גם את קובץ האודיו וגם את התמלול המדויק שלו כדי לשכפל קול. אם הטקסט של קטע ההקלטה שגוי או חלקי, איכות הפלט נפגעת מיד. הוא גם לא מציע מגוון קולות מוכנים מראש שפשוט בוחרים מתוך תפריט, אלא דורש הקלטת מקור בכל פעם.

אותה משפחה

Qwen3-TTS-12Hz יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לדבר בעברית?

לא. רשימת השפות כוללת עשר שפות ספציפיות כמו אנגלית, סינית, רוסית, גרמנית וספרדית. אין לו תמיכה בעברית או בניקוד עברי.

איזה קלט דרוש כדי לשכפל קול?

צריך לספק קובץ אודיו קצר של שלוש שניות ומעלה, יחד עם התמלול המדויק של מה שנאמר בו. המודל נעזר בשניהם כדי לבנות את פרופיל הקול.

איך מריצים

כדי להריץ אותו צריך להתקין את החבילה qwen-tts בתוספת flash-attention אם רוצים ביצועים מהירים. הקוד דורש כרטיס גרפי עם תמיכה ב־bfloat16, והמשקל הקל של 2.3 גיגה בייט מאפשר לו לרוץ בקלות על כרטיס מסך בודד עם 8 עד 12 גיגה בייט של זיכרון וידאו.

אם יש לכם שרת מקומי עם מאיץ פשוט, אין שום סיבה לשלם לספקי ענן לפי שעה. פשוט טוענים את המודל ישירות לפייתון עם generate_voice_clone. אם אין לכם גישה למאיץ גרפי ייעודי ואתם צריכים רק הפקה מזדמנת של קטעי שמע, פנייה לשירות מנוהל תחסוך את כאב הראש של תחזוקת התלויות.

pip install -U huggingface_hub
hf download Qwen/Qwen3-TTS-12Hz-0.6B-Base

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו באופן חופשי בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗