GPT
E

E2-TTS

קוד פתוח

SWividcc-by-nc-4.02024-10-14

  • f5-tts
  • text-to-speech

מודל המרת טקסט לדיבור בגישת אפס דוגמאות שמבוסס על ארכיטקטורה לא רגרסיבית פשוטה. הוא מעניין את מי שמחפש לשבט קולות במהירות בלי סיבוכים מיותרים בצנרת העבודה.

  • 2.5 GBמשקל הקבצים
  • 187,377הורדות בחודש
  • 57לייקים

מה זה

מדובר במודל שמיישם שיטה לא רגרסיבית לחלוטין לשכפול קול והקראת טקסט. המאמר המלווה מגדיר את הגישה כקלה באופן מביך, כלומר פישוט משמעותי של המבנה המקובל במודלים מתחרים, בלי לוותר על היכולת לחקות דובר על בסיס דגימה קצרה.

בפועל הוא עובד דרך הספרייה f5-tts, שפותחה במקביל אליו וכוללת גם גרסאות אחרות של המפתח. במקום להסתמך על מודלים מורכבים שמייצרים אודיו צעד אחר צעד בקצב אטי, הוא מייצר את הפלט בבת אחת, מה שאמור לקצר את זמני הריצה ולהקל על מי שמנסה להטמיע אותו מקומית על שרתים ייעודיים בלי להסתבך עם התלויות הרגילות.

מתאים ל

  • מחקר וניסויי שמע

    הקוד פתוח ומבוסס על מאמר אקדמי, מה שמאפשר לבדוק שיטות סינתזה מתקדמות בקלות.

  • שכפול קול אישי

    יצירת דיבור מקובצי אודיו קצרים לשימוש עצמי במערכות פנימיות בלי תשלום חיצוני.

  • אינטגרציה עם f5-tts

    בדיקת חלופות מול מודל F5 המקביל באותה ספריית קוד בדיוק.

איפה זה נופל

כרטיס המודל לא מפרט תמיכה בשפות נוספות מלבד אנגלית או סינית שנבדקות לרוב במחקרים כאלה, ולכן עברית כנראה תישבר לחלוטין בלי אימון מותאם. מעבר לזה, המפתח לא סיפק שום מדדי שגיאה או השוואות מספריות ישירות בעמוד עצמו, כך שאי אפשר לדעת מראש מה רמת הדיוק מול רעשי רקע.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית מהקופסה?

אין שום אזכור לתמיכה בעברית בנתוני המודל או במאמר. סביר להניח שתקבלו ג'יבריש או הגייה פגומה מאוד אם תזינו טקסט עברי ללא התאמה ייעודית.

מה ההבדל בין המודל הזה לבין F5-TTS שמופיע באותו מאגר?

מדובר בשני מודלים נפרדים שפותחו במקביל ומשתמשים באותה ספריית קוד. E2 מיועד להיות פשוט יותר מבנית, בעוד לגרסאות ה־F5 יש נקודות ביקורת מתקדמות יותר כמו צ'קפוינט של 1,250,000 צעדים.

איך מריצים

כדי להריץ אותו צריך להוריד את המשקלים ששוקלים יחד 2.5 גיגה בייט בארבעה קבצים, ולמקם את הקובץ model_1200000.safetensors בתוך תיקיית ckpts תחת E2TTS_Base. הקוד עצמו יושב בריפו של f5-tts בגיטהאב.

מבחינת חומרה, קבצים בנפח כזה דורשים כרטיס מסך מודרני עם זיכרון סביר כדי לעבוד בלי חנק. אם אין לכם כרטיס מתאים לפיתוח או אם המטרה היא סתם בדיקה מהירה של איכות הקול, הקמה של סביבה שלמה עם תלויות פייטורץ' עשויה להיות מיותרת, ועדיף פשוט להשתמש בשירות קיים שמציע גישה מוכנה למודל.

pip install -U huggingface_hub
hf download SWivid/E2-TTS

הקבצים

4 קבצים במאגר, 2.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה, מותר להוריד, לחקור, לשנות ולהריץ את המודל לצרכים פרטיים, אקדמיים או פנימיים בלבד. אם יש לכם כוונה למכור מוצר שמבוסס עליו או לגבות כסף ממשתמשי קצה, הרישיון הזה אוסר על כך במפורש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗