GPT
F

F5-TTS-Vietnamese-ViVoice

קוד פתוח

hyntcc-by-nc-sa-4.02025-07-10

  • pytorch
  • text-to-speech
  • vietnamese
  • ai-model
  • deep-learning

התאמה של F5-TTS לדיבור בווייטנאמית שאומנה על 1,000 שעות הקלטה מסוננות. פתרון ממוקד למי שצריך להקריא טקסט בווייטנאמית בהתבסס על דגימת קול קצרה.

  • 5.0 GBמשקל הקבצים
  • 2,622הורדות בחודש
  • 57לייקים

מה זה

מדובר במודל טקסט לדיבור שמבוסס על ארכיטקטורת F5-TTS Base ועבר אימון ייעודי על ארבעה מאגרי מידע שונים של דיבור בווייטנאמית, ביניהם Vi-Voice וסדרת VLSP. כדי להגיע לאיכות שמע נקייה, המפתח סינן את החומרים בעזרת Demucs להסרת מוזיקת רקע והשתמש במודל זיהוי דיבור של Zalo-AI כדי לסלק הקלטות שלא תואמות במדויק את התמלול.

האימון ארך חודש וחצי על כרטיס RTX 3090 בודד, עם חיתוך של קטעים קצרים משנייה או ארוכים מחצי דקה. התוצאה היא משקולות שמיועדות לעבוד עם ווקודר מסוג vocos ומאפשרות לשכפל סגנון דיבור מווייטנאמית לפי קובץ רפרנס וטקסט תואם.

מתאים ל

  • מחקר אקדמי בעיבוד דיבור

    אימון של 1,000 שעות מציע בסיס נקי לבדיקת ארכיטקטורות TTS בשפות עם טונאליות מורכבת.

  • פיתוח אבי טיפוס בווייטנאמית

    הקראת טקסטים מקומית לבדיקת יישומים פנימיים שלא למטרות רווח, ללא תלות ברשת.

  • שכפול קול מותאם אישית

    יצירת קריינות בווייטנאמית שמתבססת על דגימת קול קצרה של דובר ספציפי לצורכי מחקר.

איפה זה נופל

המודל מיועד אך ורק לשפה הווייטנאמית וכל הטקסט שמוזן אליו עובר המרה לאותיות קטנות. אימנו אותו רק על קטעים שבין שנייה אחת לשלושים שניות, כך שטקסטים ארוכים במיוחד ידרשו חיתוך ידני למקטעים כדי למנוע ירידה באיכות. היוצר לא פרסם מדדי הערכה כמותיים רשמיים, מה שמחייב אתכם לבדוק בעצמכם את איכות הפלט וההתאמה למבטאים שונים לפני כל שימוש.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקריינות של מוצר מסחרי?

לא. הרישיון של המודל אוסר שימוש מסחרי באופן מפורש ומגביל אותו למחקר ולניסויים בלבד. אם אתם מוכרים שירות או משלבים אותו באפליקציה בתשלום, אתם מפרים את תנאי השימוש.

האם המודל תומך בעברית או באנגלית?

לא, הוא אומן אך ורק על מאגרי דיבור בווייטנאמית. ניסיון להזין טקסט בשפות אחרות לא יניב דיבור תקין.

איך מריצים

כדי להריץ אותו צריך לשבט את הריפו הייעודי מגיטהאב, להתקין את החבילה בסביבת פייתון ולהריץ את פקודת ה־CLI עם קובץ מודל של כחמישה גיגה-בייט. נדרש כרטיס מסך ייעודי של אנבידיה עם מספיק זיכרון להחזקת המשקולות והרצת תהליך הדיפוזיה, בדומה לחומרה ששימשה לאימון.

ההרצה דורשת קובץ אודיו קצר כרפרנס יחד עם התמלול המדויק שלו, לצד הטקסט החדש שרוצים להפיק. אם אין לכם שרת עם מעבד גרפי זמין או שהצורך הוא נקודתי מאוד, עדיף להשתמש בשירותי ענן מוכנים במקום לתחזק סביבת פייתון מקומית בשביל מודל בודד.

pip install -U huggingface_hub
hf download hynt/F5-TTS-Vietnamese-ViVoice

הקבצים

4 קבצים במאגר, 5.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC-SA-4.0. המשמעות היא שאסור לחלוטין לעשות בו שימוש מסחרי, וכל שימוש מוגבל למחקר, ניסויים ופיתוח טכנולוגי בלבד. אם תשנו את המודל או תפיצו נגזרות שלו, אתם מחויבים לפרסם אותן תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗