GPT
O

OpenAI_TTS_New

רץ בדפדפן

ysharmamit2023-11-06

  • gradio

ממשק פשוט שממיר טקסט לקובצי קול באמצעות מודלי הדיבור של OpenAI. הוא מיועד למי שמחזיק מפתח גישה אישי ורוצה לבדוק את הקולות בדפדפן בלי לתכנת.

  • הורדות בחודש
  • 559לייקים

מה זה

אתם מדביקים טקסט בתיבה, בוחרים מודל וקול, ומקבלים קובץ שמע ישירות לנגן המובנה. הממשק מציע בחירה בין שני מודלים, tts-1 המהיר או tts-1-hd האיכותי יותר, לצד שישה קולות קבועים של OpenAI: alloy, echo, fable, onyx, nova ו־shimmer.

מאחורי הקלעים הקוד לא מייצר שום דבר בעצמו. מדובר במעטפת שנשענת ישירות על ספריית ה־Python של OpenAI ושולחת את הבקשה לשרתים שלהם. אין כאן מודל מקומי, כך שכל היכולות והמגבלות של הפקת הדיבור תלויות ישירות ב־API החיצוני.

מתאים ל

  • בדיקת איכות הקולות

    השוואה מהירה בין ששת הקולות של OpenAI עם טקסט ספציפי שלכם.

  • השוואת מודלים

    בדיקה מעשית של הבדלי האיכות בין tts-1 הרגיל לגרסת ה־hd.

  • הפקת שמע חד פעמית

    יצירת קובץ אודיו קצר בלי לכתוב שורת קוד או להרים סקריפט.

איפה זה נופל

האפליקציה מסומנת כרגע עם שגיאת ריצה, ולכן סביר מאוד שהיא לא תעבוד בכלל עד שהיוצר יתקן אותה. מעבר לזה, אין פה אפשרות להאזין בלי מפתח בתשלום, והממשק לא מציע שליטה במהירות הדיבור או אפשרויות הזרמת שמע בזמן אמת.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

הממשק עצמו פתוח לשימוש חופשי, אבל כדי לייצר שמע חייבים להזין מפתח אישי של OpenAI. המשמעות היא שכל המרה תעלה כסף בחשבון האישי שלכם לפי תעריפי החברה.

מה קורה עם הטקסט והמפתח שאני מזין?

המפתח והטקסט נשלחים מהדפדפן לסקריפט שמעביר אותם ישירות ל־API של OpenAI. לפי הקוד הקבצים נשמרים כקבצים זמניים בשרת שבו רץ הממשק כדי שתוכלו להאזין להם בנגן.

במה האפליקציה שונה משימוש ישיר במודל?

היא לא שונה מבחינת התוצאה הקולית. מדובר רק בממשק ויזואלי בסיסי שחוסך את הצורך לכתוב קוד כדי לבצע קריאה למודל הדיבור.

האם הממשק זמין ועובד כרגע?

המצב המדווח כרגע הוא תקלת ריצה. לכן, אם תיכנסו אליו עכשיו ייתכן שתיתקלו בשגיאה ולא תוכלו לייצר שמע עד שהמפתח יעדכן את הקוד.

איך משתמשים

כדי להפעיל את הממשק חייבים להזין קוד גישה אישי של OpenAI בשדה הייעודי. לאחר מכן כותבים את הטקסט, בוחרים דגם וקול מרשימות הבחירה, ולוחצים על הכפתור Text-To-Speech או מקישים אנטר. כיוון שהעיבוד מתבצע בשרתי OpenAI, חומרת הבסיס שהאפליקציה רצה עליה כמעט לא משפיעה על מהירות קבלת קובץ האודיו.

הרישיון

קוד האפליקציה פתוח תחת רישיון MIT, שמאפשר שימוש חופשי, העתקה ושינוי. עם זאת, התוכן שאתם מקלידים נשלח ישירות לחשבון ה־OpenAI שלכם, וכל תנאי השימוש וזכויות היוצרים על האודיו נקבעים לפי החוזה שלכם מולם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗