GPT
T

VoiceCloning-be/text-to-speech

רץ בדפדפן

VoiceCloning-begpl-2.02024-08-11

  • gradio

ממירים טקסט חופשי לקובץ שמע דיבורי ישירות מהדפדפן. מתאים למי שצריך קריינות מהירה ופשוטה בלי להסתבך עם התקנות מקומיות.

  • הורדות בחודש
  • 137לייקים

מה זה

מדביקים טקסט בתיבה ייעודית של חמש שורות, בוחרים קול מרשימת אפשרויות, ומקבלים קובץ אודיו מוכן להשמעה ולהורדה. אפשר לכוונן את קצב הדיבור באחוזים בין מינוס חמישים לפלוס חמישים, וגם לשנות את גובה הצליל בהרץ בין מינוס עשרים לפלוס עשרים.

מאחורי הקלעים רצה ספריית edge_tts שמשתמשת במנוע הדיבור של מיקרוסופט אדג'. הקוד יוצר קובץ שמע זמני על השרת ומחזיר אותו ישירות לנגן בממשק, כך שאין כאן מודל בינה מלאכותית מותאם אישית שנבנה מאפס אלא ממשק ישיר לשירות קיים.

מתאים ל

  • קריינות לסרטונים קצרים

    יצירת קובץ שמע מטקסט כתוב עם התאמת קצב כדי להדביק בעריכת וידאו.

  • הקראת טקסטים ללמידה

    המרת קטעי קריאה ארוכים לשמע כדי להאזין להם תוך כדי תנועה.

  • בדיקת אינטונציה וקולות

    השוואה בין גבהי צליל וקולות שונים עבור שורות תסריט קצרות.

איפה זה נופל

שם המשתמש והכותרת כוללים את המילים שיבוט קול, אבל אין פה שום יכולת לשבט קולות. אי אפשר להעלות דגימת קול משלכם כדי לחקות אותה, אלא רק לבחור מתוך רשימת קולות מוגדרת מראש. בנוסף, חסרות דוגמאות מובנות בממשק, כך שתצטרכו להקליד טקסט בעצמכם ולבדוק ידנית איך כל קול נשמע.

שאלות
נפוצות

האם הכלי הזה באמת משבט קולות?

לא. למרות השם של המפתח והכותרת, מדובר בממשק למנוע הטקסט לדיבור של מיקרוסופט. אי אפשר להעלות קול אישי כדי להעתיק אותו.

האם השימוש עולה כסף או דורש הרשמה?

השימוש פתוח וחינמי לגמרי דרך הדפדפן. אין צורך להתחבר עם משתמש או להזין פרטי אשראי כדי לייצר שמע.

כמה זמן לוקח לקבל את קובץ האודיו?

העיבוד לוקח מספר שניות בודדות לטקסט קצר. הוא רץ על מעבד בסיסי אך פונה ישירות למנוע חיצוני, כך שאין צוואר בקבוק משמעותי.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד מבוסס על ספריית פייתון פתוחה בשם edge-tts וממשק גרדיו פשוט. אפשר להוריד את הקוד ולהריץ אותו במחשב שלכם ללא תלות ברשת של השרת.

איך משתמשים

נכנסים לעמוד, כותבים טקסט, בוחרים קול ולוחצים על כפתור ההפעלה. אם תשכחו להזין טקסט או לבחור קול, הממשק יקפיץ אזהרה ברורה ולא יבצע שום פעולה. התהליך רץ על מעבד בסיסי בלי מאיץ גרפי, אבל מאחר שהעיבוד נשען על קריאות שירות חיצוניות דרך הקוד, השמע נוצר תוך שניות ספורות בלי המתנה ארוכה.

הרישיון

הקוד מופץ תחת רישיון gpl-2.0, שמחייב שיתוף קוד פתוח תחת אותם תנאים אם משתמשים בו בפרויקט אחר. הטקסט שאתם מזינים נשלח לעיבוד ונשמר כקובץ זמני בשרת לצורך יצירת הנגן, אך לא מצוין תנאי שימוש מסחרי בקבצי השמע עצמם.

הרישיון המלא ב־Hugging Face ↗