GPT
M

MOSS-TTS-Realtime

קוד פתוח

OpenMOSS-Teamapache-2.02026-02-09

  • transformers
  • safetensors
  • moss_tts_realtime
  • feature-extraction
  • text-to-speech

הפקת דיבור בהזרמה שמתחשבת גם בטקסט וגם באודיו מהתורות הקודמים בשיחה. הוא שומר על אופי הקול והאינטונציה ברצף שיחה שלם ולא מפיק כל משפט בנפרד.

  • 2.3Bפרמטרים
  • 4.4 GBמשקל הקבצים
  • 18,136הורדות בחודש
  • 104לייקים

מה זה

מערכות דיבור רגילות מתייחסות לכל משפט שתשלחו להן כאירוע בודד ומנותק. המודל הזה מתבסס על ארכיטקטורת MossTTSRealtime ונבנה מראש לסוכני שיחה קוליים, כך שהוא מזין לעצמו את ההיסטוריה של השיחה, כולל הטקסט והמאפיינים האקוסטיים של הדובר הקודם, כדי להחזיר תגובה טבעית ועקבית.

הוא אומן על היקף חריג של מעל 2.5 מיליון שעות דיבור של דובר בודד, ובנוסף יותר ממיליון שעות שיחה בין שני דוברים ויותר. הנתונים האלה מאפשרים לו לתמוך בחלון הקשר של עד 32 אלף טוקנים, שמתרגם לכ־40 דקות שיחה רציפה שבהן הקול לא מאבד את האופי או מתחיל להישמע מתכתי. בנוסף, הוא כולל תמיכה מוצהרת בעברית לצד עוד כ־19 שפות.

מתאים ל

  • בוט קולי רציף למוקדים

    זוכר את האקוסטיקה של השיחה עד 40 דקות ולא משנה את הקול או הקצב בין משפט למשפט.

  • סוכן דיאלוג רב לשוני

    תומך בעברית, אנגלית ועוד שפות באותו מודל, מה שחוסך תחזוקה של מנועים שונים לכל שפה.

  • שכפול קול אינטראקטיבי

    מייצר קול עקבי לפי דגימה קצרה ושומר על אחידות הקול לאורך חילופי הדברים בשיחה.

איפה זה נופל

בכרטיס המודל חסרים לגמרי נתוני שיהוי וזמני תגובה אמיתיים בהזרמה, כך שאי אפשר לדעת מראש תוך כמה מילישניות הצליל הראשון נפלט בפועל. מעבר לזה, למרות שהשפה העברית מופיעה ברשימת השפות הנתמכות, אין שום פירוט על כמות המידע בעברית שנכללה בתוך מאגרי האימון העצומים. מודלים רב-לשוניים כאלה נוטים לסבול ממבטא זר, הגיות לא מדויקות או בעיות בטקסט לא מנוקד בעברית, ולכן חובה להריץ בדיקות איכות מחמירות על אודיו מקומי לפני שמשלבים אותו במערכת פעילה.

שאלות
נפוצות

איך המודל הזה מתנהג טוב יותר מ־TTS רגיל בשיחות?

רוב המנועים מקבלים רק את המשפט האחרון ומייצרים אותו באפס הקשר. המודל הזה מקבל את ההיסטוריה של השיחה יחד עם מאפייני השמע הקודמים, ולכן האינטונציה והתגובה שלו מתאימות לרוח הדברים שנאמרו לפני רגע.

האם אפשר לסמוך על התמיכה שלו בעברית?

העברית רשומה רשמית בין 20 השפות הנתמכות, אבל אין שום פירוט על איכות הסינתזה או כמות המידע בעברית מתוך 2.5 מיליון שעות האימון. צריך להוריד ולבדוק בפועל איך הוא מתמודד עם מילים מורכבות, שמות ומבטא לפני שמחליטים להשתמש בו.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.4 גיגה-בייט עם כ־2.3 מיליארד פרמטרים, מה שאומר שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון יחזיק אותו בקלות. ההרצה המקומית דורשת סביבת פייתון 3.12, התקנה של Transformers בגרסה 5.0.0 ושימוש בחבילות פייטארץ' מותאמות לקודה דרך המאגר הרשמי בגיטהאב.

אם אתם לא רוצים להחזיק שרת דלוק עם מעבד גרפי רק בשביל שיחות מזדמנות, עדיף להשתמש ב־API של הפרויקט. שרת מקומי שווה את ההשקעה רק כשאתם צריכים שליטה מלאה בנתונים ובזמני ההשהיה בלי תלות ברשת חיצונית.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="OpenMOSS-Team/MOSS-TTS-Realtime")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון אפאצ'י 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗