GPT
M

MaskGCT

קוד פתוח

amphioncc-by-nc-4.02024-10-13

  • safetensors
  • text-to-speech
  • en
  • zh
  • ko

הפיכת טקסט לדיבור בגישת zero-shot שמסוגלת לשכפל קול לפי דגימת אודיו קצרה. מתאים למי שצריך סינתזת דיבור רב לשונית המבוססת על מודלי שפת קודק.

  • 6.1 GBמשקל הקבצים
  • 404הורדות בחודש
  • 309לייקים

מה זה

במקום לעבוד עם מודל אחד כבד, הפרויקט הזה מחלק את משימת הדיבור לכמה שלבים נפרדים. יש כאן שני רכיבי קודק, סמנטי ואקוסטי, לצד מודל שממיר טקסט לטוקנים סמנטיים ומודל נוסף שממיר אותם לטוקנים אקוסטיים. הגישה הזו משתמשת בלמידה מוסתרת כדי לחזות את המאפיינים של הקול, בלי להסתמך על ארכיטקטורות אוטורגרסיביות רגילות שנוטות להיתקע בהזיות שמע.

האימון עצמו נשען על מאגר Emilia בהיקף של מאה אלף שעות דיבור באנגלית ובסינית, מחצית מהכמות לכל שפה. המבנה המודולרי מאפשר להשתמש ברכיבים השונים בנפרד, כולל בחירה בין גרסה של שכבה אחת לגרסה מלאה בשלב המעבר בין הייצוג הסמנטי לאקוסטי.

מתאים ל

  • שכפול קול באנגלית

    יצירת קריינות קולית מותאמת אישית מתוך דגימת שמע קצרה בלבד, בלי לאמן את המודל מחדש.

  • מחקר קודקים של שמע

    ניתוח והפרדה בין ייצוג טוקנים סמנטיים לייצוג אקוסטי בפרויקטים אקדמיים.

  • דיבוב לסינית ואנגלית

    הפקת דיבור על בסיס מאגר ענק של מאה אלף שעות בשתי השפות המרכזיות האלו.

איפה זה נופל

הבעיה המרכזית עבור קהל מקומי היא השפות. למרות שמתויגות שם שפות נוספות כמו צרפתית, גרמנית, יפנית וקוריאנית, האימון המוצהר מכיל רק אנגלית וסינית. עברית בכלל לא קיימת בנתונים, כך שאי אפשר לייצר איתו דיבור בעברית.

נוסף על כך, הפיצול לארבעה מודלים שונים מסבך את התהליך. שרשור של ארבע תחנות שונות יוצר צוואר בקבוק של זמני תגובה, מה שעלול להקשות על שימוש במערכות שדורשות מענה בזמן אמת.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל אומן רק על אנגלית וסינית מתוך מאגר Emilia. הוא לא מכיר פונטיקה או טקסט בעברית ויחזיר שגיאה או מלמול.

האם מותר להטמיע אותו במוצר של סטארטאפ?

לא, הרישיון אוסר כל שימוש מסחרי. מותר להשתמש בו אך ורק לצורכי מחקר, לימוד או בדיקות שאינן למטרות רווח.

למה יש שני קבצים שונים ל־s2a?

המפתחים מספקים גרסה של שכבה אחת וגרסה מלאה. הגרסה הקלה נועדה לפעולות מהירות יותר וחיסכון במשאבים, בעוד הגרסה המלאה נותנת איכות גבוהה יותר.

איך מריצים

כדי להריץ אותו צריך להוריד תשעה קבצים שונים ששוקלים יחד 6.1 גיגה בייט. תצטרכו לשבט את המאגר של Amphion מגיטהאב, להריץ סקריפט סביבה ייעודי, ולהוריד את כל המשקולות באופן ידני או דרך הספרייה של Hugging Face.

מבחינת חומרה, הנפח הכולל של הקבצים דורש כרטיס מסך עם לפחות שמונה עד שתים עשרה גיגה בייט של זיכרון כדי לטעון את כל החלקים יחד. אם אתם צריכים בדיקה חד פעמית, יש להם דמו חי בחינם ב־Hugging Face Spaces וחבל להרים בשבילו שרת מקומי.

pip install -U huggingface_hub
hf download amphion/MaskGCT

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: אין שימוש מסחרי מכל סוג שהוא. אם אתם מפתחים מוצר, אפליקציה בתשלום או כלי פנימי לחברה עסקית, אסור לכם להשתמש במשקולות האלה. מותר להשתמש בהן רק למחקר, ניסויים אישיים ופרויקטים לא מסחריים, תוך מתן קרדיט ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗