GPT
M

MOSS-VoiceGenerator

קוד פתוח

OpenMOSS-Teamapache-2.02026-02-08

  • safetensors
  • moss_tts_delay
  • text-to-speech
  • custom_code

מודל דיבור שיוצר גוון קול ישירות מתיאור טקסט חופשי, בלי צורך בקובץ אודיו קיים לשיבוט.

  • 2.1Bפרמטרים
  • 4.0 GBמשקל הקבצים
  • 73,300הורדות בחודש
  • 47לייקים

מה זה

המודל מייצר דיבור מתוך שני קלטים: הטקסט להקראה והוראה מילולית שמתארת את אופי הקול, הרגש, הגיל, הקצב וגובה הצליל. במקום להסתמך על מאגר קולות קבוע מראש או לדרוש הקלטת רפרנס של כמה שניות, הוא מתרגם את הפרומפט הטקסטואלי למאפיינים אקוסטיים בתהליך אחד שמחבר סגנון ותוכן.

בארכיטקטורת MossTTSDelay מבוצע חיבור ישיר בין הוראות הסטייל לטקסט המבוקש. במבחן סובייקטיבי פנימי של 160 דגימות שנבדקו לפי העדפה כללית, מעקב אחרי הוראות וטבעיות, היוצרים מדווחים על עדיפות על פני חלופות שלא מבוססות על קולות מוגדרים מראש, אבל אין כאן השוואה מול בנצ'מרקים ציבוריים מוכרים.

מתאים ל

  • דיבוב דמויות למשחקים

    יצירת קול ייחודי לכל דמות לפי תיאור אישיות ורגש בלי לשכור מדבבים לכל שורת טקסט באנגלית ובסינית.

  • הפקת ספרי שמע מרובי קולות

    הגדרת גוני קול נפרדים למספר ולדמויות שונות באמצעות פרומפטים טקסטואליים בלבד.

  • יצירת קולות בסיס למערכות דיבור

    הפקת דגימות סאונד ייחודיות מאפס כדי שישמשו מקור לשיבוט במודלי דיבור אחרים.

איפה זה נופל

המודל תומך רק באנגלית ובסינית, כך שעבור עברית אין לו שום מענה. בנוסף, הכרטיס מציין רגישות גבוהה להיפרפרמטרים של הדגימה, מה שאומר שסטייה מהערכים המומלצים פוגעת ישירות באיכות ובקצב הדיבור. המדידות שהוצגו נשענות על 160 דוגמאות בדיקה פנימיות בלבד, בלי בדיקות שגיאת מילים או מדדי דמיון סטנדרטיים.

שאלות
נפוצות

האם המודל יודע לדבר בעברית?

לא. התמיכה המוצהרת היא באנגלית ובסינית בלבד, והוא אינו מיועד לפענוח או הגייה של טקסט בעברית.

האם חייבים קובץ קול קודם כדי לייצר איתו דיבור?

לא, וזה המאפיין המרכזי שלו. הוא מייצר את מאפייני הקול ישירות מתיאור טקסט חופשי, כמו גיל, מגדר וטון דיבור, ללא צורך בהקלטת מקור.

איזה כרטיס מסך נדרש בשביל להריץ אותו?

הקבצים שוקלים כ־4 גיגה בייט, כך שכרטיס מסך מודרני עם 8 עד 12 גיגה בייט זיכרון יספיק לטעינה ולהסקה, רצוי עם תמיכה ב־FlashAttention 2.

איך מריצים

המשקל הכולל עומד על 4.0 גיגה בייט, כך שכרטיס מסך בודד עם 8 עד 12 גיגה בייט זיכרון יספיק בהחלט להרצה מקומית. הסביבה דורשת פייתון 3.12, חבילות פייטורץ בגרסה 2.9.1 עם תמיכה בגרסת קודה 12.8, וספריית טרנספורמרס בגרסה 5.0.0. התקנת FlashAttention 2 מומלצת לחסכון בזיכרון ולהאצה, אך דורשת כרטיס מתאים.

למי שרוצה רק לבדוק הפקה של קול מסוים בלי לנהל תלויות של גרסאות קודה ספציפיות, אפשר להשתמש ב־API או בסטודיו של MOSI במקום להרים סביבה מקומית.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-VoiceGenerator

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0 המלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗