GPT
T

tts-1.6b-en_fr

קוד פתוח

kyutaicc-by-4.02025-06-30

  • moshi
  • tts
  • audio
  • text-to-speech
  • en

מודל פתוח להקראת טקסט בהזרמה חיה, שמתחיל לדבר כבר אחרי המילים הראשונות בלי לחכות לכל המשפט. הוא עובד באנגלית ובצרפתית, ונבנה במיוחד לשיחות ולזמני תגובה אפסיים.

  • 3.8 GBמשקל הקבצים
  • 163,793הורדות בחודש
  • 379לייקים

מה זה

המודל הזה מייצר אודיו תוך כדי קבלת הטקסט, בניגוד לרוב מודלי ההקראה שמחכים לפסקה שלמה לפני שהם מוציאים צליל ראשון. למרות השם שמציין 1.6 מיליארד, יש לו בפועל 1.8 מיליארד פרמטרים, שמחולקים בין מודל בסיס של מיליארד פרמטרים ומודל עומק של 600 מיליון. הוא משתמש בטוקנייזר האודיו Mimi ומייצר צליל בקצב של 12.5 הרץ, עם השהיה מובנית של 1.28 שניות בין הטקסט לדיבור כדי לשמור על איכות והקשר.

המפתחים אימנו אותו על 2.5 מיליון שעות שמע ציבוריות עם תמלולים של וויספר, וביצעו זיקוק להנחיה ללא מסווג כדי לא להכפיל את גודל האצווה בזמן ריצה. התוצאה היא תפוקה שמגיעה לפי 75 מהזמן האמיתי על חומרה מתאימה, מה שהופך אותו לאחד הכלים היחידים בקטגוריה הזו שמתאימים לעיבוד מקבילי של שיחות בזמן אמת.

מתאים ל

  • סוכני שיחה קוליים

    הזרמת דיבור מיידית מאפשרת לבוט לענות למשתמש ברצף טבעי וללא שתיקות מעיקות.

  • הקראת ממשקים חיים

    השמעת מידע שמתעדכן ברגע זה, כמו תוצאות ספורט או הוראות ניווט, ישירות מהמילים הראשונות.

  • מערכות דיאלוג דו לשוניות

    התאמה מובנית לשיחות שמשלבות אנגלית וצרפתית ללא צורך בהחלפת מודל באמצע.

איפה זה נופל

הבעיה המרכזית עבור קהל מקומי היא היעדר מוחלט של תמיכה בעברית, המודל אומן אך ורק על אנגלית וצרפתית. בנוסף, המפתחים חסמו שכפול קול חופשי מכל קובץ, ואפשר להשתמש רק בווקטורי קול מוכנים מראש מתוך מאגר ייעודי. המודל גם לא כולל סימון מים דיגיטלי, שלטענת היוצרים נוטרל לחלוטין על ידי קידוד האודיו, כך שאין שום דרך מובנית לוודא שהפלט נוצר במחשב.

שאלות
נפוצות

אפשר להזין לו קובץ קול קצר ולשכפל את הדובר מיד?

לא. המודל לא תומך בשכפול קול פתוח מכל דגימה. הוא מוגבל אך ורק לשימוש בווקטורי קול מוכנים שהוכנו מראש ונמצאים במאגר הקולות של הפרויקט.

האם המודל יצליח להקריא מילים בעברית שמשולבות במשפט באנגלית?

לא, הוא אומן רק על אנגלית וצרפתית. מילים בעברית יגרמו לשיבוש בהגייה או לשתיקה, ולכן הוא לא רלוונטי לטקסט ישראלי.

למה מודל ההזרמה הזה עדיף על מודל TTS רגיל?

במודל רגיל צריך להמתין שהטקסט יסתיים לחלוטין לפני שמתחיל עיבוד האודיו. כאן הצליל מתחיל להתנגן כמעט מיד עם הגעת המילים הראשונות למערכת.

איך מריצים

הקבצים שוקלים 3.8 גיגה בייט, כך שצריך כרטיס מסך מודרני עם לפחות שמונה עד שנים עשר גיגה זיכרון כדי להחזיק את המודל, את Mimi ואת שכבת הריצה של ספריית moshi. הקוד דורש את מאגר delayed-streams-modeling של המפתחים, ואפשר לשחק עם מספר טוקני האודיו בכל פריים, מתוך 32 הקיימים, כדי להאיץ עוד יותר את הביצועים.

אם אתם לא בונים מערכת קולית אינטראקטיבית שחייבת להגיב תוך שבריר שנייה, אין שום סיבה להרים בשבילו שרת ייעודי. לכל שימוש של הקראת מאמרים אופליין עדיף לפנות ל־API מסחרי רגיל, שיחסוך לכם תחזוקת תשתיות של מודל הזרמה מורכב.

pip install -U huggingface_hub
hf download kyutai/tts-1.6b-en_fr

הקבצים

6 קבצים במאגר, 3.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון CC-BY 4.0 מתיר שימוש מסחרי חופשי, שינוי והפצה של המשקולות בכל מוצר או שירות. התנאי היחיד הוא מתן קרדיט ברור למפתחי המודל, בלי הגבלות נוספות על קוד סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗