GPT
M

Ming-omni-tts-0.5B

קוד פתוח

inclusionAIapache-2.02026-02-11

  • onnx
  • safetensors
  • dense
  • text-to-speech
  • custom_code

מודל דיבור שמייצר בערוץ אחד גם קול, גם מוזיקה וגם רעשי רקע. הוא מיועד למי שרוצה שליטה עמוקה ברגש ובניואנסים קוליים, בעיקר עבור תוכן בסינית.

  • 1.6Bפרמטרים
  • 3.1 GBמשקל הקבצים
  • 14,484הורדות בחודש
  • 38לייקים

מה זה

המודל משלב דיבור, מוזיקה ואפקטים קוליים ישירות מאותו תהליך ייצור, במקום להדביק שכבות סאונד בעריכה נפרדת. הוא כולל מעל 100 קולות מובנים ויודע לייצר קולות חדשים לחלוטין מתוך תיאור טקסטואלי חופשי, לצד שכפול קול מקובץ דגימה. הדגש כאן הוא על שליטה עדינה בקצב, גובה צליל, רגשות וניבים, לצד טיפול בטקסטים טכניים מסובכים כמו נוסחאות במתמטיקה וכימיה.

במבחני ביצועים בסינית הוא הציג 0.83% שגיאות מילים בשכפול קול, דיוק של 93% בשליטה בניב קנטונזי, וציון של 76.20% במילוי הוראות קוליות. נתון שמעיד על הבדל מהותי הוא דיוק של 46.7% במודול הרגש מול 40% במודלים מתחרים כמו קוזי-וויס, אבל המספר הזה גם מראה ששליטה מדויקת ברגש עדיין מפספסת ברוב המקרים.

מתאים ל

  • הקראת מאמרים מדעיים

    המודל מטפל ישירות בנוסחאות מתמטיקה וכימיה בלי לשבור את רצף הדיבור.

  • הפקת פודקאסטים עשירים

    הוא מייצר דיבור לצד אפקטים ומוזיקת רקע בערוץ אחד ברמת יעילות טובה.

  • יצירת דמויות לפי תיאור

    עיצוב קולות חדשים ישירות מהוראות טקסטואליות בלי להקליט דוגמאות מראש.

איפה זה נופל

המודל פותח סביב השפה הסינית. המבחנים שלו, כולל ביצועי נימול הטקסט עם 1.97% שגיאות תו והערכות הניבים, נבדקו בסינית בלבד. אין שום תיעוד לביצועים בעברית, וסביר מאוד שהוא פשוט לא יקרא עברית בצורה שמישה. בנוסף, למרות שהדיוק הרגשי שלו מוביל בקטגוריה, הוא עומד על 46.7% בלבד, מה שאומר שיותר מחצי מהניסיונות לכוון רגש ספציפי לא יפגעו בדיוק בתוצאה המבוקשת.

אותה משפחה

Ming-omni-tts יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים למוצר בעברית?

לא. כל הנתונים, הבדיקות והאימונים מתמקדים בסינית, עם דמו באנגלית. עברית לא נתמכת כאן.

כמה זיכרון כרטיס מסך נחוץ להרצה?

הקבצים שוקלים 3.1 גיגה בייט. כרטיס מסך עם 8 עד 12 גיגה זיכרון יספיק להרצה מקומית.

האם הוא מחליף עריכת סאונד שלמה?

הוא מייצר מוזיקה ואפקטים יחד עם הקול, אבל רמת השליטה במיקס לא משתווה לעריכה ידנית רב ערוצית.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.1 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון מריץ אותו בלי בעיה מקומית. הרצה כזו מתאימה במיוחד כשצריך זמן תגובה מהיר או עיבוד של תוכן שלא רוצים לשלוח לרשת חיצונית.

למרות השם שכולל חצי מיליארד, בפועל יש לו 1.6 מיליארד פרמטרים. תהליך ההרצה דורש משיכה של הקוד מגיטהאב והרצת סקריפט בדיקה בפייתון. אם אתם עובדים בקנה מידה גדול ומחפשים פתרון מנוהל בלי לתחזק שרתים ותלויות תוכנה סביב ארכיטקטורת ביילינג, עדיף לפנות לפתרונות ענן מוכנים.

pip install -U huggingface_hub
hf download inclusionAI/Ming-omni-tts-0.5B

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בלי צורך לחשוף את הפיתוחים שלכם. התנאי היחיד הוא שמירה על זכויות היוצרים המקוריות והצהרת הרישיון בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗