GPT
Q

Qwen3-TTS-GGUF

קוד פתוח

Serveurpersoapache-2.02026-05-11

  • gguf
  • tts
  • text-to-speech
  • voice-cloning
  • voice-design

המרת משקולות של מודל הדיבור של עליבאבא לפורמט קל להרצה מקומית. הפתרון מיועד למי שרוצה להפיק אודיו מהר בלי שרתים כבדים ובלי תלות בספק חיצוני.

  • 55.9 GBמשקל הקבצים
  • 747,297הורדות בחודש
  • 41לייקים

מה זה

הפרויקט מביא את ארכיטקטורת הדיבור של עליבאבא לקובצי GGUF שרצים ישירות דרך מנוע מבוסס C פלוס פלוס. המערכת מחולקת לשני חלקים שנטענים יחד, מודל שפה שמייצר ייצוגי דיבור בתדר 12 הרץ, ומפענח אודיו שמתרגם אותם לפלט שמע של 24 קילוהרץ. יש כאן תמיכה בשמונה שפות כולל אנגלית, מנדרינית, צרפתית וספרדית, אבל אין תמיכה בעברית.

המודל מגיע בשני גדלים של 0.6 מיליארד ו־1.7 מיליארד פרמטרים, עם שלושה מצבי עבודה. המצב הבסיסי מדבר בקולות מוגדרים מראש, מצב שיבוט לוקח קטע שמע קיים ומחקה אותו, ומצב עיצוב קול, שקיים רק בגרסה הגדולה, בונה קול יש מאין מתוך תיאור טקסטואלי של מאפיינים. במבחני הסטרימינג של לוח המובילים הפתוח הוא הגיע למקום הראשון במהירות התחלת השמע, מה שאומר שההשהיה מרגע שליחת הטקסט ועד לשמיעת הצליל הראשון היא הנמוכה ביותר שנמדדה שם.

מתאים ל

  • בוטים קוליים בזמן אמת

    זמן התגובה הקצר לצליל ראשון מאפשר לייצר שיחות קוליות מהירות באנגלית ובשפות נתמכות בלי שיהוקים.

  • שיבוט קול מקומי

    חיקוי קול מתוך קובץ שמע ישירות על החומרה המקומית, בלי לשלוח הקלטות רגישות לשרת חיצוני.

  • מערכות משובצות ומחשבים ניידים

    דרישות הזיכרון הנמוכות במצב מכווץ מאפשרות הפקת שמע שוטפת גם על מעבדים פשוטים או מאיצים גרפיים קטנים.

איפה זה נופל

החיסרון הברור ביותר הוא היעדר מוחלט של עברית. שמונה השפות הנתמכות הן סינית, אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית ויפנית, ולכן אי אפשר להשתמש בו ישירות למוצרים מקומיים. בנוסף, מצב עיצוב הקול לפי תיאור קיים רק בגרסת 1.7 מיליארד ולא בדגם הקטן של 0.6 מיליארד. מי שמחפש איכות אודיו באולפן צריך לזכור שהפלט הוא מונו בלבד בתדר 24 קילוהרץ, ולפני שילוב במוצר חי חובה לבדוק שהשמירה על מבנה הקול והטבעיות בשיבוט יציבים מספיק ולא נשברים במשפטים מורכבים.

שאלות
נפוצות

האם המודל יודע להקריא טקסט בעברית?

לא. רשימת השפות המוגדרת כוללת שמונה שפות בלבד, ביניהן אנגלית, צרפתית וסינית. הזנה של עברית תניב ג'יבריש או שקט, ולא מומלץ לבנות עליו לפרויקטים מקומיים בלי אימון ייעודי.

האם חייבים כרטיס מסך של אנבידיה כדי להריץ אותו?

לא בהכרח. המנוע נבנה סביב C פלוס פלוס ותומך במגוון סביבות, כולל כרטיסי מסך של אפל דרך מטאל, כרטיסים שונים דרך וולקן, ואפילו הרצה מלאה על מעבד רגיל של מחשב אישי.

איך מריצים

ההרצה נעשית דרך qwentts.cpp, ללא תלות בפייתון. בונים את הקוד ומריצים אותו על גבי מעבדים גרפיים של אנבידיה, כרטיסי אפל דרך מטאל, התקנים מבוססי וולקן, או על גבי מעבד מרכזי רגיל. גרסת ברירת המחדל המומלצת היא Q8_0, שדורשת בערך 2.1 גיגה בייט למודל הדיבור הגדול ועוד כ־291 מגה בייט לטוקנייזר, כך שכל העסק נכנס בקלות בכרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון.

אם יש לכם מחשב מוגבל מאוד, גרסת Q4_K_M חותכת את הדרישות לכ־1.2 גיגה בייט עבור המודל ועוד 255 מגה בייט למפענח. לעומת זאת, גרסאות הדיוק המלא כמו F32 מיועדות בעיקר לפיתוח ובדיקות ושוקלות פי כמה. שווה להרים את זה לבד רק אם יש צורך בהשהיה אפסית, עבודה באופליין או פרטיות מלאה, אחרת ניהול התשתית העצמאי מיותר.

ollama run hf.co/Serveurperso/Qwen3-TTS-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל המקורי של עליבאבא והמפענח משוחררים ברישיון אפאצ'י 2.0, וכלי ההרצה משוחרר ברישיון MIT. השילוב הזה נותן אור ירוק מלא לשימוש מסחרי, שינוי קוד, הפצה ושילוב בתוך תוכנות קנייניות, בתנאי ששומרים על הודעות זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗