GPT
K

KaniTTS

רץ בדפדפן

nineninesixapache-2.02025-09-17

  • gradio

הופך טקסט מוקלד לקובץ שמע מדבר בכמה שפות. מתאים למי שרוצה לבדוק מודלים קלים של דיבור ישירות בדפדפן בלי להתקין סביבת פיתוח.

  • הורדות בחודש
  • 115לייקים

מה זה

אתם בוחרים מודל מתוך רשימה, בוחרים דובר, מקלידים טקסט ולוחצים על כפתור ההפעלה. בתמורה מקבלים נגן עם קובץ השמע שנוצר ודיווח על הזמן שלקח לייצר אותו. למטה יש דוגמאות מוכנות מראש שאפשר להפעיל מיד כדי לשמוע תוצאות בלי להקליד.

מאחורי הקלעים רצים מודלים ממשפחת kani-tts בגדלים של 370M עד 450M פרמטרים, כולל גרסאות ייעודיות לאנגלית, סינית, גרמנית וספרדית. פענוח האודיו מסתמך על המקודד nemo-nano-codec של Nvidia שרץ בקצב דגימה של 22kHz. יש גם הגדרות מתקדמות של טמפרטורה, top-p, אורך טוקנים מרבי ו־repetition penalty למי שרוצה לשלוט באופי ההפקה.

מתאים ל

  • בדיקת איכות קולות

    השוואה מהירה בין המודלים השונים באנגלית, ספרדית, גרמנית או סינית כדי לבחון איכות הבעה.

  • הפקת דגימות דיבור קצרות

    יצירה ישירה של קובצי שמע מתוך טקסט להורדה מהירה דרך נגן האודיו המובנה.

  • ניסוי בפרמטרי יצירה

    כוונון ערכי טמפרטורה ו־top-p כדי לראות איך הם משפיעים על היציבות והאינטונציה של הדיבור.

איפה זה נופל

עברית לא מופיעה כאן ברשימת השפות הנתמכות, אז אין מה לבנות עליה להקראת טקסט מקומי. בנוסף, חומרת zero מקצה משאבים רק בזמן ריצה, מה שיכול לייצר השהיה עד שהמעבד הגרפי מתעורר או אם יש עומס של משתמשים אחרים באותו רגע.

שאלות
נפוצות

האם השימוש כרוך בתשלום?

לא, הממשק פתוח וחינמי לחלוטין בדפדפן. אין צורך להזין אמצעי תשלום ואין צורך לפתוח חשבון.

האם אפשר להריץ את זה מקומית?

כן, המודלים והקוד פתוחים ברישיון apache-2.0. אפשר להוריד את המשקלים מ־Hugging Face, להשתמש במקודד של Nvidia ולהריץ על מחשב עם כרטיס מסך מתאים.

כמה זמן לוקח לייצר קטע שמע?

המודלים קטנים מאוד ונשענים על מעבד A10G, כך שהעיבוד עצמו לוקח שניות בודדות. הממשק אפילו מציג תיבת טקסט עם מדידת הזמן המדויקת שלקחה הריצה.

האם הטקסט שאני מקליד נשמר איפשהו?

הטקסט נשלח לעיבוד בשרת שבו רץ ה־Space ב־Hugging Face. זה לא מיועד לחומרים סודיים או מידע רגיש, אבל ההדגמה עצמה לא שומרת היסטוריה ציבורית של מה שכתבתם.

איך משתמשים

נכנסים לממשק, בוחרים שפה ומודל, כותבים משפט ולוחצים על Run. אין צורך בהרשמה או התחברות. היישום רץ על חומרת zero-a10g שמקצה כרטיס גרפי לפי דרישה, כך שאם השרת קר ייתכן שתחכו כמה שניות לטעינה, אבל יצירת האודיו עצמה במודלים בסדר גודל כזה מתבצעת מהר.

הרישיון

הקוד והממשק מפורסמים תחת רישיון apache-2.0, שמתיר שימוש חופשי כולל שימוש מסחרי והפצה. התוכן שאתם מייצרים והטקסט שאתם מזינים מעובדים על גבי התשתית של Hugging Face.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗