GPT
M

MOSS-TTSD-v1.0

קוד פתוח

OpenMOSS-Teamapache-2.02026-02-08

  • transformers
  • safetensors
  • moss_tts_delay
  • feature-extraction
  • text-to-speech

מודל פתוח שמייצר שיחות שלמות בין עד חמישה דוברים באודיו אחד רציף. הוא שומר על אופי הקולות והדינמיקה גם בהקלטות של עד שעה.

  • 8.4Bפרמטרים
  • 15.6 GBמשקל הקבצים
  • 10,334הורדות בחודש
  • 59לייקים

מה זה

בניגוד לרוב מודלי הדיבור שמקריאים משפט בודד, המודל הזה מתמקד בשיחות מרובות משתתפים. הוא מקבל טקסט עם תיוג דוברים ודגימות קול קצרות של שלוש עד עשר שניות, ומייצר דיאלוג שכולל חילופי דברים וקטיעות דיבור טבעיות. הוא מתבסס על ארכיטקטורת שנאי יחידה שחוזה טוקנים של אודיו במקביל באמצעות השהיה.

בבדיקות מול מודלים פתוחים ומסחריים, הוא מציג דיוק שיוך דוברים של מעל 95 אחוזים גם באנגלית וגם בסינית, מה שאומר שהוא כמעט לא מתבלבל בין הקולות בשיחה. עם זאת, מדד שיעור שגיאות המילים שלו באנגלית עומד על 0.0988, נתון פחות טוב מזה של מודלים קנייניים כמו אילבן לאבס או ג'מיני שנעים סביב 0.082 עד 0.087.

מתאים ל

  • הפקת פודקאסטים אוטומטית

    יצירת דיאלוג רציף בין מספר מנחים מאודיו קצר, עם שמירה על קולות עקביים לאורך שעה.

  • דיבוב סצנות עם כמה שחקנים

    הפקת שיחה מרובת משתתפים עם אינטראקציה וקטיעות הדדיות מקובץ טקסט יחיד.

  • הקראת ספרי שמע עם דמויות

    הפרדה מדויקת בין קול המספר לקולות הדמויות בספר ללא צורך בהדבקת מקטעים נפרדים.

איפה זה נופל

המודל מציג שיעור שגיאות מילים גבוה יחסית באנגלית בהשוואה למתחרים סגורים, ולכן עלולות להיות בו טעויות בהגיית מילים. בנוסף, אף שעברית מופיעה ברשימת השפות הנתמכות, הטבלאות מציגות נתונים ומדידות בסינית ובאנגלית בלבד. אין שום מידע על רמת הדיוק, איכות ההגייה או שמירת המבטא בעברית, ולכן חובה לבדוק את השפה בפועל לפני שמסתמכים עליו.

אותה משפחה

MOSS-TTSD יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל באמת מייצר שיחות אמינות בעברית?

הקוד של המודל כולל תמיכה ברמת הטוקנייזר לשפה העברית, אך המפתחים פרסמו מדדי איכות רק לסינית ולאנגלית. איכות ההגייה, הדיוק הפונטי והטונציה של דיאלוג בעברית לא נבדקו במחקר, ומומלץ לבדוק דגימות באופן עצמאי לפני תחילת פיתוח.

כמה זמן אודיו מקבלים מכל טוקן בריצה?

קצב הפקת הטוקנים של הארכיטקטורה הוא בערך 12.5 טוקנים לשנייה אחת של קול. בהתאם לזה יש לקבוע את פרמטר האורך המקסימלי כדי למנוע חיתוך של הדיאלוג באמצע המשפט.

איך מריצים

כדי להריץ אותו מקומית צריך לפחות 24 גיגה בייט זיכרון כרטיס מסך עבור משקלי המודל וההקשר הארוך. הסביבה דורשת פייתון 3.12, חבילות פייטורץ' ייעודיות לגרסת קודה 12.8, וספריית טרנספורמרס בגרסה 5.0.0. התקנת פלאש אטנשן 2 מומלצת כדי לקצר זמנים ולחסוך בזיכרון, אך מחייבת חומרה תומכת ותהליך הידור שלעיתים נתקע.

אם אתם לא צריכים שיחה ארוכה ומתמשכת אלא רק קריינות קצרה, עדיף להשתמש במודל קטן יותר או לקרוא לשירות ענן. מעבר לכך, למפתחים יש ממשק בדיקה ב־AIStudio ודוקומנטציה של ממשק תכנות ייעודי למי שמעדיף לא לנהל שרתים עצמאיים.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="OpenMOSS-Team/MOSS-TTSD-v1.0")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון אפאצ'י 2.0 המלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗