GPT
M

MOSS-TTS-v1.5

קוד פתוח

OpenMOSS-Teamapache-2.02026-05-25

  • safetensors
  • moss_tts_delay
  • text-to-speech
  • custom_code
  • zh

מודל דיבור בקוד פתוח עם 8.5 מיליארד פרמטרים, שמביא תמיכה ב־31 שפות כולל עברית ומאפשר שכפול קול יציב לצד שליטה מפורשת בזמני השהיה ישירות מהטקסט.

  • 8.5Bפרמטרים
  • 15.8 GBמשקל הקבצים
  • 467,503הורדות בחודש
  • 203לייקים

מה זה

הגרסה הזו ממשיכה את מודל הבסיס ומתמקדת בדיוק הפרוזודיה וביציבות של שכפול קול מדגימות קצרות. מעבר להקראת טקסט רגילה, אפשר לשלוט על משך ההגייה ברמת הטוקן, להשתמש באלפבית פונטי בינלאומי להגייה מדויקת, ולהגדיר שתיקות מתוזמנות בתוך הטקסט כמו השהיה של כמה שניות בדיוק בנקודה מסוימת.

בגודל של שמונה וחצי מיליארד פרמטרים, מדובר במודל דיבור כבד ביחס למקובל בתחום, אך הוא מפצה על כך ביכולת מעבר חלקה בין שפות שונות באותו משפט. הוספת תגיות שפה מפורשות בזמן הפנייה משפרת את הדיוק בחלק גדול מ־31 השפות הנתמכות, שכוללות כעת גם עברית וערבית.

מתאים ל

  • הקראת ספרים ופודקאסטים

    שליטה מדויקת בהפסקות נשימה והשהיות מתוזמנות מאפשרת הפקת שמע ארוך שנשמע טבעי ולא רציף מדי.

  • דיבוב ושכפול קול

    המודל שומר על יציבות דגימת הקול המקורית גם כשמזינים קטע ייחוס ארוך כדי להקריא משפט קצר.

  • הדרכות רב-לשוניות

    תמיכה במעבר בין שפות באותו טקסט מאפשרת הקראת מונחים טכניים באנגלית בתוך משפטים בעברית.

איפה זה נופל

אם תשמיטו את תגית השפה בזמן הקריאה, איכות הפלט עלולה לרדת בחלק מהשפות ואפילו להציג נסיגה לעומת הגרסה הקודמת. המפתחים מודים שהדיוק תלוי בהגדרה ידנית של השפה, כך שזיהוי אוטומטי מלא אינו אמין כאן.

בנוסף, המשקל הכבד של שמונה וחצי מיליארד פרמטרים מייצר השהיה ראשונית מורגשת לפני תחילת השמע. זה לא כלי שמתאים כרגע לעיבוד קולי עם תגובה מיידית ללא אופטימיזציה כבדה או שרתי עיבוד מרובי כרטיסים.

אותה משפחה

MOSS-TTS יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית בלי התאמות מיוחדות?

עברית נוספה לרשימת השפות הנתמכות, אך כדי לקבל תוצאה סבירה חובה להגדיר את תגית השפה he בפנייה. ללא התגית הזו המודל מתקשה ועלול לייצר הגייה משובשת.

כמה זיכרון וידאו צריך בפועל בשביל להרים אותו מקומית?

הקבצים תופסים כמעט 16 גיגה-בייט, ולכן תצטרכו כרטיס עם לפחות 24 גיגה-בייט זיכרון כדי לטעון את המודל ולבצע הסקה. שימוש ב־FlashAttention מומלץ כדי לחסוך בזיכרון ולהאיץ את הריצה.

איך מייצרים שתיקה מוגדרת מראש בין משפטים?

אפשר להכניס לתוך הטקסט פקודה ישירה כמו pause 3.2s בסוגריים מרובעים. המודל ישהה את הדיבור למשך הזמן המדויק שביקשתם לפני שימשיך למילה הבאה.

איך מריצים

כדי להריץ אותו מקומית תצטרכו סביבת פייתון מבודדת עם כרטיס מסך חזק שמחזיק מעל 16 גיגה זיכרון וידאו רק כדי לטעון את המשקלים, ועדיף כרטיס מודרני שתומך ב־FlashAttention כדי לקבל מהירות סבירה ולא לחנוק את החומרה. הקוד דורש גרסאות ספציפיות של פייטארץ׳ וספריות תואמות קודה.

אם אתם צריכים תגובה מהירה בזמן אמת לשיחה קולית, או שאין לכם חומרה ייעודית בענן, הרצה עצמאית תהיה יקרה וכבדה, ועדיף לבדוק פנייה ל־API המרוחק שהמפתחים מציעים בענן שלהם.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-TTS-v1.5

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל במוצרים מסחריים, לשנות אותו, להריץ אותו באופן פנימי ולהפיץ עבודות נגזרות. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והצהרה על שינויים שבוצעו בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗