GPT
M

MOSS-TTS-Nano-100M

קוד פתוח

OpenMOSS-Teamapache-2.02026-04-02

  • pytorch
  • moss_tts_nano
  • text-to-speech
  • custom_code
  • zh

מודל הקראת טקסט זעיר שמפיק אודיו סטריאו באיכות גבוהה ישירות ממעבד. הוא מתאים למי שרוצה לשכפל קול מקומית בלי לגעת בשרתי ענן או במאיצי עיבוד גרפיים יקרים.

  • 32,768טוקנים בהקשר
  • 227 MBמשקל הקבצים
  • 60,809הורדות בחודש
  • 237לייקים

מה זה

מדובר במודל המרת טקסט לדיבור שפועל בארכיטקטורה אוטורגרסיבית מלאה, המשלבת מודל שפה עם דוחס אודיו ייעודי של עשרים מיליון פרמטרים. השילוב הזה מייצר צליל בקצב דגימה של 48 קילוהרץ בשני ערוצי סטריאו, תכונה חריגה במיוחד למודלים במשקל קל כל כך שנוטים לרוב להסתפק בערוץ מונו בסיסי.

הוא מתוכנן במיוחד לשיבוט קול מהיר לפי דגימת מקור קצרה, תוך שמירה על זמני תגובה נמוכים שמתאימים לשידור אודיו בזמן אמת. בנוסף למבנה הפנימי הקומפקטי, הוא תומך בחלוקה אוטומטית למקטעים עבור טקסטים ארוכים כדי לשמור על רצף הדיבור ללא קריסה של הזיכרון.

מתאים ל

  • הקראת ממשק מקומית

    יצירת קולות מערכת ואזהרות על חומרת קצה פשוטה בלי חיבור לרשת ובלי צורך במאיץ גרפי ייעודי.

  • שיבוט קול מיידי

    הפקת דיבור בקול מותאם אישית מתוך דגימת אודיו קצרה, ישירות דרך פקודת שורת פקודה.

  • קריינות תכנים ארוכים

    הקראת קובצי טקסט שלמים באמצעות מנגנון החלוקה האוטומטי למקטעים שמונע שגיאות זיכרון.

איפה זה נופל

למרות שתגיות המודל כוללות סימון של עברית, טבלת עשרים השפות הרשמיות בתיעוד אינה כוללת עברית כלל, אלא שפות כמו סינית, אנגלית ופרסית. אל תבנו עליו לפרויקט בעברית בלי בדיקה מעשית של איכות ההגייה.

מעבר לכך, ההתקנה עשויה לדרוש הידור ידני של חבילות עיבוד טקסט חיצוניות אם ההתקנה הראשונית נכשלת, ודיוק שכפול הקול מושפע לחלוטין מאיכות ההקלטה שתספקו לו כדוגמה.

שאלות
נפוצות

האם המודל באמת תומך בעברית?

במטא דאטה של הפרויקט מופיע הסימון של עברית, אך ברשימת השפות הנתמכות בגוף התיעוד היא לא מוזכרת. מומלץ להריץ בדיקה עם טקסט קצר לפני שמתכננים עליו מוצר מקומי.

האם חייבים מעבד גרפי כדי להשתמש בו?

לא, המודל תוכנן לעבוד ישירות על גבי מעבד מרכזי בעל ארבע ליבות ומייצר צליל בהזרמה ללא צורך בכרטיס מסך מיוחד.

מה דרוש כדי לשכפל קול של אדם?

כל מה שצריך הוא קובץ אודיו קצר שמשמש דוגמה עבור הפרמטר הייעודי, יחד עם מחרוזת הטקסט שרוצים להקריא.

איך מריצים

אין צורך בשום כרטיס מסך כדי להתחיל לעבוד איתו. מעבד מרובע ליבות סטנדרטי מספיק כדי לחולל אודיו בהזרמה ישירה, והפרויקט כולל ממשק שורת פקודה ושרת מבוסס פסט איי פי איי שנטען ברקע.

אם אתם צריכים להרים שירות מהיר לעשרות אלפי משתמשים במקביל בלי לנהל תשתית שרתים, שירות ענן מנוהל עדיין יחסוך כאב ראש. לכל יישום מקומי, כלי פנימי או שרת קטן, הקוד פשוט ורץ עצמאית בלי תלויות כבדות.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-TTS-Nano-100M

הרישיון

הרישיון המוגדר במטא דאטה הוא אפאצ'י שתיים, שמתיר שימוש מסחרי חופשי ושינוי קוד. יחד עם זאת, הטקסט במאגר מזהיר מפורשות שכל עוד קובץ הרישיון לא פורסם במלואו יש להתייחס אליו ככזה שאינו מורשה להפצה מחדש. בדקו את קובץ הרישיון במאגר לפני הטמעה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗