GPT
M

maskgct

רץ בדפדפן

amphionmit2024-10-18

  • gradio

הופכים טקסט מוקלד לדיבור שנשמע כמו הקלטה קיימת. מתאים למי שרוצה לשבט קול או להפיק קריינות ישירות בדפדפן בלי להוריד מודלים.

  • הורדות בחודש
  • 259לייקים

מה זה

אתם מעלים קובץ שמע שמשמש כדגימת קול ומקלידים את הטקסט שאתם רוצים להשמיע. הפלט שמתקבל הוא קובץ אודיו חדש שבו הטקסט שלכם מוקרא באותו הגוון של הדגימה המקורית.

מאחורי הקלעים רצה שרשרת מורכבת של מודלים. המערך כולל את MaskGCT של amphion לצד רכיבים כמו w2v-bert-2.0 של מטא לחילוץ מאפיינים סמנטיים, ורכיבי RepCodec לעיבוד האות. הקוד משתמש גם בספריות פיענוח פונטי כמו g2p ומודלים נוספים של אנבידיה ומיקרוסופט לאימות קול, כך שלא מדובר במודל יחיד אלא במערכת מרובת שלבים שממירה טקסט לייצוג אקוסטי וממנו לצליל סופי.

מתאים ל

  • שכפול קול לקריינות

    מעלים הקלטה קצרה של דובר באנגלית או סינית ומייצרים ממנה משפטים חדשים באותו גוון דיבור.

  • בדיקת מודל MaskGCT

    בוחנים את ביצועי הארכיטקטורה של amphion על דוגמאות אישיות לפני שמורידים את המשקלים למחשב.

  • הפקת דגימות דיבור

    יוצרים קטעי אודיו קצרים של עד 1024 תווים לשימוש במצגות או באבות טיפוס של פרויקטים.

איפה זה נופל

ההגבלה הראשונה והברורה ביותר היא אורך הטקסט, שנחתך ב־1024 תווים. מעבר לזה, הקוד טוען ספריות פונטיות ייעודיות לאנגלית ולסינית, כך שאין שום הבטחה או עדות לתמיכה בעברית. אם תנסו להקריא טקסט מקומי, סביר להניח שהפלט ישתבש או ייכשל לחלוטין. כמו כן, איכות התוצאה תלויה לחלוטין ברמת ההקלטה שהעליתם כדגימה.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הממשק פתוח ורץ בחינם על גבי Hugging Face. החומרה מוקצית באופן שיתופי לפי עומס המשתמשים באותו רגע.

מה קורה עם קובצי הקול שאני מעלה לכאן?

הקבצים שלכם נשלחים לשרת לצורך עיבוד ההקלטה ויצירת האודיו החדש. מאחר שמדובר בהדגמה ציבורית ברשת, לא כדאי להעלות לשם שיחות אישיות או חומרים רגישים.

כמה זמן לוקח לקבל קובץ אודיו מוכן?

העיבוד עצמו מתבצע על גבי מעבד גרפי מדגם A10G ולוקח לרוב שניות בודדות עד חצי דקה. עם זאת, אם יש עומס על תשתית Spaces, ייתכן שתמתינו מעט בתור עד שהמעבד יתפנה למשימה.

האם הממשק הזה תומך בהקראת טקסט בעברית?

לא לפי מה שמופיע בקוד המקור. המודלים של הפונטיקה והעיבוד בנויים סביב אנגלית וסינית, ולכן טקסט בעברית צפוי להיכשל או להפיק צלילים לא ברורים.

האם אפשר להריץ את כל הסיפור הזה במחשב שלי?

כן, הקוד והמשקלים פתוחים ברישיון MIT וזמינים להורדה. תצטרכו להתקין את כל הספריות שמופיעות בקוד ולהחזיק מעבד גרפי תואם כדי לקבל זמני ריצה סבירים.

איך משתמשים

מעלים קובץ קול דרך שדה ה־Upload Prompt Wav, מקלידים עד 1024 תווים בתיבת הטקסט, ומשחקים עם מדדי ה־Slider והמספרים אם רוצים לכוונן את התוצאה. השרת מבוסס על מעבד גרפי A10G דרך תשתית ZeroGPU, כך שהעיבוד מהיר יחסית אבל ייתכן שתמתינו בתור קצר להקצאת החומרה. אין צורך בחשבון בתשלום כדי להפעיל את זה.

הרישיון

הפרויקט מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי, כולל שינוי הקוד ושימוש מסחרי, כל עוד שומרים על הודעת זכויות היוצרים המקורית. קובצי השמע שאתם מעלים ומייצרים מעובדים על שרתי ה־Space לפי תנאי השירות הכלליים של Hugging Face.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗