GPT
V

VieNeu-TTS-v3-Turbo

קוד פתוח

pnnbao-umpapache-2.02026-06-05

  • onnx
  • safetensors
  • vieneu_v3_turbo
  • voice-cloning
  • code-switching

מודל המרת טקסט לדיבור ייעודי לוייטנאמית ואנגלית שמפיק אודיו באיכות 48kHz. הוא רץ ישירות על מעבד בלי פייתורץ' ומציע שכפול קול מהיר מקליפ קצר.

  • 131Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 505,045הורדות בחודש

מה זה

מדובר במודל קטן של 131 מיליון פרמטרים שנבנה מאפס ואומן על כעשרת אלפים שעות של דיבור באנגלית ובוייטנאמית, ללא הסתמכות על ארכיטקטורה קיימת. הוא משלב את קודק האודיו MOSS-Audio-Tokenizer-Nano ומפיק דיבור בקצב דגימה של 48kHz, שזה שיפור מורגש לעומת גרסאות קודמות בסדרה שנעצרו ב־24kHz. המערכת כוללת עשרים קולות מובנים שמכסים מבטאים שונים מוייטנאם ותומכת במעבר טבעי בין שפות באותו משפט.

הייחוד המשמעותי נמצא בהטמעה הטכנית. דרך חבילת הפייתון vieneu, המודל עובד על מעבדים באמצעות ONNX Runtime ובפורמט int8 כברירת מחדל, מה שמבטל לחלוטין את התלות ב־PyTorch בסביבות קלות. זמני התגובה בהזרמה עומדים על כ־300 מילישניות לפריים הראשון, עם קצב יצירה שמהיר פי שניים עד שלושה מזמן אמת במחשב נייד ועד פי שבעה במעבדי אפל.

מתאים ל

  • בוטים קוליים באנגלית

    זמן תגובה של 300 מילישניות והזרמה ישירה ממעבד רגיל מתאימים מאוד לשיחות בזמן אמת.

  • דיבוב דו-לשוני

    המודל עובר חלק בין אנגלית לוייטנאמית באותו משפט בלי לשבור את רצף הדיבור.

  • שכפול קול מקומי

    מאפשר לשכפל קול מקליפ של שלוש שניות ישירות על המחשב בלי לשלוח מידע לשרתים חיצוניים.

איפה זה נופל

חלון ההקשר מוגבל ל־1,024 טוקנים, ולכן הוא לא נועד לקריאת מסמכים שלמים במכה אחת אלא דורש חלוקה מוקדמת לפסקאות. שליטה ישירה בסגנון הקריאה דרך פרמטרים בוטלה בגרסה זו, והיא תלויה לחלוטין בקובץ הקול או בדגימת הרפרנס שתספקו. מי שמחפש תמיכה בעברית יגלה שהמודל עיוור לחלוטין לשפה הזו ומיועד אך ורק לוייטנאמית ואנגלית. בנוסף, דאטה-סט האימון המלא אינו ציבורי וסגור לגישה.

שאלות
נפוצות

האם כדאי לשכור שרת GPU ייעודי כדי להריץ אותו?

לא עבור שיחות או הזרמה בזמן אמת. על מעבד רגיל המודל רץ דרך ONNX ומגיב תוך 300 מילישניות, כך שכרטיס מסך נותן יתרון רק בעיבוד כמויות גדולות של טקסט באצוות.

האם המודל מסוגל להקריא טקסט בעברית?

לא. הוא אומן באופן בלעדי על וייטנאמית ואנגלית, ואין לו שום תמיכה או פונמיזציה לעברית.

האם מותר להשתמש בקולות המובנים בתוך סרטונים מסחריים?

כן. עשרים הקולות המובנים שוחררו תחת רישיון אפאצ'י 2.0 עם הסכמת הדוברים, כך שניתן להשתמש באודיו המופק לכל מטרה מסחרית.

איך מריצים

ברוב המקרים אין צורך בכרטיס מסך. מתקינים את vieneu ומריצים על המעבד, כאשר המנוע משתמש ב־ONNX ומייצר אודיו בהזרמה ישירה בלי משאבים כבדים. אם אתם עובדים על מחשבי מק עם סיליקון, הנתיב הזה אפילו מהיר יותר משימוש בהאצת חומרה.

המעבר לכרטיס מסך של אנבידיה עם CUDA ופייתורץ' נדרש רק אם אתם מייצרים כמויות גדולות של טקסט במקביל ורוצים לנצל עיבוד באצוות. לשימוש אינטראקטיבי או להזרמה קולית בזמן אמת, הרצה מקומית על מעבד פשוט תספק תוצאות מהירות יותר ולא תצדיק תשלום על שרתי GPU או קריאות API חיצוניות.

pip install -U huggingface_hub
hf download pnnbao-ump/VieNeu-TTS-v3-Turbo

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0 מלא, כולל משקלי המודל, קובצי ה־ONNX ועשרים הקולות המובנים. אפשר להשתמש בו במוצרים מסחריים, למכור את תוצרי האודיו ולהפיץ אותו, כל עוד שומרים על הודעת הרישיון המקורית והקרדיט למפתח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗