GPT
T

TTS-Spaces-Arena

רץ בדפדפן

Pendrokarzlib2024-03-04

  • gradio
  • arena

הכלי מציג מבחן עיוור בין מודלים שונים של דיבור, שבו אתם שומעים תוצאות ומצביעים למה שנשמע טוב יותר. הוא מתאים למי שרוצה לבדוק איכות של מנועי קול פתוחים לפני שבוחרים אחד לפרויקט.

  • הורדות בחודש
  • 487לייקים

מה זה

הרעיון כאן הוא השוואה עיוורת ישירה בין מנועי טקסט לדיבור. אתם מזינים טקסט, מקבלים שתי דגימות אודיו שונות בלי לדעת מי יצר מה, ומצביעים לביצוע הטבעי והמשכנע יותר מביניהם. המטרה היא לאסוף דירוג קהילתי אמין שלא מושפע מהשם של החברה או מההייפ סביב מודל כזה או אחר.

מאחורי הקלעים רצים כאן כמה וכמה מודלים פתוחים מוכרים, כולל MaskGCT של amphion, מודל MegaTTS3 של בייטדאנס, orpheus-3b של קנופי לאבס, XTTS-v2 של קוקי, שורה של גרסאות ממשפחת fish-speech, וגם Kokoro-82M הקומפקטי. התוצאות נשמרות בדאטהסט ציבורי ייעודי כדי לעקוב אחרי הביצועים של כולם לאורך זמן.

מתאים ל

  • השוואת איכות עיוורת

    שומעים שני קולות שונים על אותו משפט בדיוק ובוחרים את זה שנשמע הכי אנושי בלי לדעת מי עומד מאחוריו.

  • בדיקת מודלים חדשים

    בוחנים מנועי קול קטנים וגדולים כמו קוקורו או פיש ספיץ' על אותם טקסטים כדי להבין את הפערים ביניהם.

  • תרומה לדירוג הקהילתי

    מצביעים על ביצועים ומסייעים בבניית מאגר מידע פתוח שמשווה בין ביצועי מודלי שמע שונים ברשת.

איפה זה נופל

ההשוואה הזו מתבססת על שרת חלש יחסית, כך שזמני ההמתנה לא משקפים את מהירות המודלים כשהם רצים על חומרה מתאימה עם כרטיס מסך. בנוסף, רוב המודלים האלה אומנו בעיקר על אנגלית ושפות נפוצות אחרות, כך שלבדוק עליהם עברית ייתן כנראה ג'יבריש או תוצאה שבורה לחלוטין. אל תבנו על זה ככלי הפקה שוטף, כי הוא בנוי רק לבדיקות קצרות ולדירוג הדדי.

שאלות
נפוצות

האם השימוש בעמוד הזה עולה כסף?

לא, הגישה חופשית לגמרי דרך הדפדפן ללא תשלום. אין צורך להכניס אמצעי תשלום, ואפשר פשוט להיכנס ולהתחיל לייצר דגימות שמע ולהצביע להן.

מה קורה עם הטקסטים שמזינים לשם?

הנתונים וההצבעות נשמרים במאגר מידע פתוח בשם TTS Arena שנגיש לכולם ברשת. לכן לא מומלץ בשום אופן להקליד שמות פרטיים, מידע רגיש או סודות מסחריים.

אפשר להריץ את כל הסיפור הזה על המחשב שלי?

כן, הקוד פתוח וכולל הוראות הרצה מקומיות עם פייתון. פשוט מריצים את הסקריפט עם משתנה סביבה ייעודי שמונע סנכרון למסד הנתונים הראשי, ואם צריך מגדירים גם טוקן גישה.

למה לוקח לקולות זמן להיווצר?

האפליקציה מוגדרת על שרת חינמי עם מעבד בסיסי בלבד וללא מאיץ גרפי. חישוב של מודלי שמע כבדים על מעבד כזה דורש כמה שניות טובות, ולעיתים יש גם תור של משתמשים אחרים.

איך משתמשים

נכנסים לממשק הגראדיו בדפדפן, כותבים או מדביקים את הטקסט שרוצים לשמוע, ולוחצים על כפתור ההפקה. המערכת שולחת את הבקשה ומחזירה שני קטעי שמע להאזנה. אחרי שמקשיבים, לוחצים על ההצבעה שלכם והשמות של שני המודלים נחשפים.

בגלל שהאפליקציה יושבת על חומרת מעבד בסיסית, cpu-basic, יצירת האודיו יכולה לקחת זמן ולא לקרות מיד, במיוחד בעומס. לא חייבים להתחבר עם משתמש רשום כדי לבדוק, אבל חשבונות אנונימיים עלולים להיתקל בהגבלות קצב של פלטפורמת האחסון.

הרישיון

הקוד מופץ ברישיון zlib, שהוא רישיון קוד פתוח מתירני מאוד שמאפשר שימוש חופשי כמעט לכל מטרה. קחו בחשבון שכל הצבעה והקלטה נשמרות במאגרי מידע ציבוריים פתוחים, ולכל מודל שרץ ברקע יש רישיון מקורי משלו שצריך לבדוק בנפרד.

הרישיון המלא ב־Hugging Face ↗