GPT
G

GLM-TTS

קוד פתוח

zai-orgרישיון לא דווח2025-12-10

  • glm-tts
  • safetensors
  • llm
  • tts
  • zero-shot

מודל דיבור שמייצר אודיו עם רגש וחיקוי קול מדגימה קצרה. הוא מתאים למי שחייב הזרמה בזמן אמת ושליטה מדויקת בהגייה של מילים.

  • 8.3 GBמשקל הקבצים
  • 187הורדות בחודש
  • 351לייקים

מה זה

הארכיטקטורה כאן מחולקת לשניים. בשלב הראשון מודל שפה שמבוסס על Llama הופך את הטקסט לרצף של טוקנים קוליים, ובשלב השני מודל Flow Matching יחד עם ווקודר מייצרים מזה גל קול שלם. המפתחים השתמשו בלמידת חיזוק עם תגמולים על רגש, צחוק ודיוק כדי לפתור את בעיית הדיבור הרובוטי והמונוטוני.

במבחני ההשוואה של seed-tts-eval גרסת ה־RL שלו הגיעה לשיעור שגיאות תווים של 0.89 לעומת 1.38 של CosyVoice2 ו־1.53 של F5-TTS. זה אומר שהוא מפספס או בולע פחות אותיות בזמן הקריאה, בזמן שרמת הדמיון לקול המקורי עומדת על 76.4 ושומרת על תוצאה קרובה מאוד למתחרים הפתוחים.

מתאים ל

  • בוטים קוליים באנגלית

    התמיכה בהזרמה ישירה מאפשרת להפיק תשובות קוליות בדיאלוג חי בלי לחכות לסיום יצירת כל המשפט.

  • דיבוב תכנים דו-לשוניים

    הוא מותאם לעבודה עם טקסט מעורב של אנגלית וסינית, ומתמודד היטב עם שילוב מונחים לועזיים.

  • שליטה ידנית בהגייה

    האפשרות להזין פונמות לצד הטקסט הרגיל עוזרת למנוע טעויות קריאה של מילים בעלות כפל משמעות.

איפה זה נופל

התמיכה מוגבלת לשפות סינית ואנגלית בלבד. עברית בכלל לא נמצאת בתוכנית כאן, ואם תנסו להזין טקסט מקומי תקבלו ג'יבריש או שגיאות הגייה צורמות. בנוסף, המודל דורש דגימת קול נקייה של 3 עד 10 שניות כדי לחקות דובר, ואם ההקלטה רועשת התוצאה נשמעת מקוטעת.

המבנה הדו-שלבי מוסיף מורכבות לחישוב בזמן אמת. למרות התמיכה בהזרמה, צריך לבדוק היטב את זמני התגובה מקצה לקצה לפני שמחברים אותו למוקד טלפוני או לצ'אט קולי אינטראקטיבי.

שאלות
נפוצות

האם המודל תומך בהקראת טקסטים בעברית?

לא. המודל אומן ונבדק על שילוב של אנגלית וסינית בלבד. אין לו תמיכה בצלילים או בפונמות של השפה העברית.

כמה שמע צריך לספק כדי לשכפל קול של דובר חדש?

דרושה דגימת שמע קצרה באורך של 3 עד 10 שניות בלבד. איכות החיקוי תלויה בניקיון של ההקלטה שסיפקתם.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־8.3 גיגה-בייט, כך שצריך כרטיס מסך עם זיכרון גרפי סביר כדי להחזיק את שני השלבים שלו יחד בזמן ריצה. ההתקנה דורשת לשכפל את המאגר של glm-tts, להתקין את התלויות ולהריץ סקריפט פייתון מקומי.

אם המוצר שלכם צריך רק מענה קולי מהיר בלי לשבת על שרת ייעודי או להחזיק תשתית GPU דולקת ברקע, כנראה שעדיף להשתמש ב־API קיים. הרצה עצמית שווה את הטרחה רק אם אתם צריכים שליטה על רמת הפונמות או שאתם בונים מערכת שמחייבת הזרמה מקומית.

pip install -U huggingface_hub
hf download zai-org/GLM-TTS

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המודל. במצב כזה אין אישור מפורש להפיץ אותו, להשתמש בו במוצר מסחרי או אפילו להריץ אותו בארגון בלי להסתכן בתביעה. עד שהם יעדכנו קובץ רישיון מסודר בקוד, השימוש בו מוגדר כמסוכן משפטית לכל מטרה שאינה מחקר ובדיקה פנימית.

הרישיון המלא בעמוד המודל ↗