GPT
M

MOSS-TTS-Local-Transformer-v1.5

קוד פתוח

OpenMOSS-Teamapache-2.02026-06-04

  • transformers
  • safetensors
  • moss_tts_local
  • feature-extraction
  • text-to-speech

מודל דיבור בקוד פתוח עם 4.6 מיליארד פרמטרים, שמייצר אודיו סטריאופוני באיכות 48 קילוהרץ ותומך בשיבוט קול ובשליטה מפורשת בעצירות.

  • 4.6Bפרמטרים
  • 8.5 GBמשקל הקבצים
  • 100,344הורדות בחודש
  • 69לייקים

מה זה

הגרסה הזו ממשיכה את סדרת MOSS-TTS ומתמקדת בשיפור איכות השמע וביציבות של שיבוט הקול. המעבר למקודד MOSS-Audio-Tokenizer-v2 מאפשר לו להפיק ישירות אודיו בשני ערוצים, תכונה די נדירה במודלי יצירת דיבור פתוחים שרובם עדיין מוגבלים למונו.

הוא תומך ב־31 שפות, כולל עברית וערבית, ומאפשר שליטה ברמת משך הטוקנים, הגייה באמצעות פיניין או IPA, ותגיות עצירה מפורשות בתוך הטקסט כמו שניות המתנה מוגדרות. לפי הכרטיס, ציון תגית השפה בבקשה קריטי בגרסה 1.5, כי השמטה שלה עלולה להוביל לפגיעה באיכות בחלק מהשפות בהשוואה לגרסה הקודמת.

מתאים ל

  • הפקת פודקאסטים בסטריאו

    פלט שני ערוצים טבעי ב־48 קילוהרץ שמספק עומק מרחבי בלי צורך במעבדי סאונד חיצוניים.

  • שיבוט קול מונחה עריכה

    שילוב תגיות עצירה מפורשות ומשך טוקנים כדי לדייק אינטונציה של קריין קיים.

  • שרת דיבור מבוסס SGLang

    הזרמת מקטעי קול בזמן אמת דרך נקודת קצה תואמת ממשק OpenAI למוצרים מרובי משתמשים.

איפה זה נופל

הבעיה הבולטת ביותר היא התלות המחייבת בהגדרת שפה ידנית. אם תשכחו להעביר את תגית השפה, תקבלו ירידה באיכות הפלט בחלק מהשפות. בנוסף, המודל מחייב שימוש קשיח בעומק של 12 קודבוקים, וכל ניסיון לשנות את פרמטר ה־VQ בהסקה יידחה מיד בשגיאה.

שיבוט הקול עדיין רגיש לקטעי התייחסות ארוכים מאוד מול טקסט קצר, למרות הדיווח על שיפור בנושא. סביבת הפיתוח דורשת גרסאות קצה ספציפיות מאוד כמו פייתון 3.12 ו־Transformers מגרסה 5.0 ומעלה, מה שיכול לתקוע פרויקטים קיימים עם ספריות ישנות.

שאלות
נפוצות

האם המודל עובד בעברית?

עברית מופיעה ברשימת 31 השפות הנתמכות בגרסה 1.5. עם זאת, חובה לציין את תגית השפה במפורש בעת שליחת הבקשה, אחרת איכות הפלט וההגייה עלולות להיפגע.

אפשר להריץ אותו על מחשב רגיל בלי מעבד גרפי?

הקוד כולל אפשרות נסיגה לחישוב על מעבד מרכזי, אבל עבור 4.6 מיליארד פרמטרים ופענוח קודק כבד, זה יהיה אטי מדי לשימוש מעשי. תצטרכו מעבד גרפי עם לפחות 16 ג'יגה זיכרון כדי לקבל זמני תגובה סבירים.

איך מריצים

המשקל עומד על 8.5 ג'יגה בייט בפורמט Transformers סטנדרטי, אבל דורש טעינה עם קוד מרוחק מאושר. כדי להריץ 4.6 מיליארד פרמטרים בהסקה תצטרכו כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון, במיוחד אם משלבים את FlashAttention 2 וטוענים בדיוק של 16 ביט.

לסביבת ייצור אפשר להרים אותו ישירות דרך SGLang-Omni, שמספק שרת תואם API של OpenAI כולל הזרמת אודיו ב־PCM בזמן אמת. אם אין לכם שרת ייעודי עם מעבד גרפי חזק, הפרויקט מציע API חיצוני ב־AIStudio של mosi.cn.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים להשתמש בו ליישומים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗