GPT
M

metavoice-1B-v0.1

קוד פתוח

metavoiceioapache-2.02024-02-06

  • metavoice
  • pretrained
  • text-to-speech
  • en

מודל פתוח להקראת טקסט ושיבוט קול באנגלית עם דגש על אינטונציה ורגש. הוא מתאים למי שרוצה שליטה מלאה על הקולות בלי לשלם לפי דקת דיבור לשירות ענן.

  • 4.7 GBמשקל הקבצים
  • 241הורדות בחודש
  • 789לייקים

מה זה

המודל מגיע עם 1.2 מיליארד פרמטרים ואומן על מאה אלף שעות של דיבור באנגלית. המטרה העיקרית שלו היא לייצר דיבור שנשמע אנושי ולא רובוטי, תוך שמירה על קצב וטון רגשי, בלי להמציא הברות באמצע המשפט. הוא מסוגל לשבט קול אמריקאי או בריטי בלי אימון מוקדם מתוך קובץ דגימה של 30 שניות, ותומך גם באימון עמוק יותר על קולות ספציפיים, למשל דוברים במבטא הודי מקובץ של דקה אחת בלבד.

הארכיטקטורה כאן מורכבת מכמה שלבים נפרדים. קודם כל יש מודל שפה שמנחש טוקנים של אודיו ישירות מהטקסט ומאפייני הדובר, ואז מודל דיפוזיה הופך אותם בחזרה לגל קול. היוצרים שילבו ברקע גם מודל ניקוי בשם DeepFilterNet כדי לסנן רעשים ותופעות לוואי שנוצרות בתהליך הדיפוזיה, מה שחוסך התעסקות עם עיבוד סאונד ידני אחרי ההפקה.

מתאים ל

  • שיבוט קול לפודקאסטים

    שיבוט מהיר של קריינים באנגלית מדגימה קצרה של חצי דקה, להפקת פרקים שלמים בלי צורך להקליט מחדש באולפן.

  • דיבוב דמויות למשחקים

    הפקת דיאלוגים רגשיים באנגלית שנשמעים טבעיים יותר מהקראה רגילה, תוך שמירה על יציבות הקול של הדמות.

  • הקראת ספרים דיגיטליים

    המרת טקסטים ארוכים באנגלית לדיבור זורם שלא נשמע מונוטוני, בהרצה מקומית על גבי שרת ייעודי.

איפה זה נופל

המודל תומך כרגע אך ורק בשפה האנגלית, כך שאין מה לנסות להקריא איתו עברית. בנוסף, למרות שהיוצרים מתכננים להוסיף יכולות הזרמה וטקסטים באורך שרירותי, בגרסה הזו הן עדיין לא קיימות, מה שאומר שלא תוכלו לייצר תגובות קוליות בזמן אמת בצ'אטבוט. בעיה נוספת נובעת ממודל הדיפוזיה עצמו, שמשאיר לכלוך ורעשי רקע באודיו, ולכן המערכת חייבת להריץ שלב ניקוי נוסף שלא תמיד ינקה הכל באופן מושלם.

שאלות
נפוצות

האם המודל תומך בהזרמת אודיו בזמן אמת?

לא. היכולת הזו מסומנת בתוכניות העבודה לעתיד אבל עדיין לא קיימת בגרסה הנוכחית. כרגע צריך לחכות שהמודל יסיים לייצר ולנקות את כל קובץ הקול לפני שאפשר להשמיע אותו למשתמש.

האם אפשר להקריא איתו טקסטים בעברית?

לא. המודל אומן אך ורק על שפה אנגלית ומכיל טוקנייזר ייעודי שמותאם לאנגלית בלבד. ניסיון להזין אותיות בעברית פשוט לא יעבוד.

כמה דאטה צריך כדי לאמן אותו על קול מותאם אישית?

עבור קולות אמריקאים או בריטיים מספיק קובץ אודיו של שלושים שניות ללא אימון נוסף. עבור מבטאים אחרים, המפתחים מדווחים שהצליחו לאמן את המודל בהצלחה אפילו עם דקה אחת של נתוני דיבור.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.7 גיגהבייט. כדי להריץ את המודל הזה בצורה סבירה תצטרכו כרטיס מסך עם לפחות שמונה עד שנים עשר גיגהבייט של זיכרון ייעודי, בעיקר בגלל שרשרת העיבוד שכוללת גם מודל שפה וגם מודל דיפוזיה. הקוד דורש את הספרייה הייעודית של היוצרים מגיטהאב, ויש בו תמיכה מובנית בזיכרון מטמון ובחלוקה לאצוות שמקצרות את זמני ההמתנה.

אם אין לכם כרטיס מסך מתאים בשרת, או שאתם צריכים רק להקריא כמה פסקאות פעם בשבוע, עדיף להשתמש בפתרון ענן קיים. הקמה של סביבה מקומית עם כל התלויות והמודלים הנלווים שווה את הטרחה רק כשמייצרים אודיו באופן שוטף ורוצים לשבט קולות פרטיים.

pip install -U huggingface_hub
hf download metavoiceio/metavoice-1B-v0.1

הקבצים

6 קבצים במאגר, 4.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד, לאמן אותו מחדש ולשלב אותו במוצרים שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית ומציינים את השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗