GPT
V

VieNeu-TTS

קוד פתוח

pnnbao-umpapache-2.02025-10-28

  • safetensors
  • qwen2
  • text-to-speech
  • vi

מודל המרת טקסט לדיבור בווייטנאמית עם יכולת שכפול קול מהירה. הוא שוקל רק 1.1 גיגה בייט ומיועד לריצה מקומית על המכשיר.

  • 553Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 2,736הורדות בחודש

מה זה

הפרויקט הזה מביא מודל דיבור מבוסס ארכיטקטורת שפה, Qwen2ForCausalLM, בגודל של כ־553 מיליון פרמטרים. הוא עבר כוונון עדין על בסיס NeuTTS Air ומשתמש במאגר של 1,000 שעות הקלטה בווייטנאמית כדי לייצר דיבור טבעי. היכולת המרכזית כאן היא שכפול קול מיידי באמצעות דגימת אודיו של שלוש עד חמש שניות בלבד, ללא צורך באימון מחדש של המודל.

מבחינת ביצועים, היוצר מדרג את הגרסה הזו כאיכותית ביותר מבין הווריאנטים שלו, תוך שמירה על מהירות גבוהה בריצה עם שרתי הסקה כמו LMDeploy. קיימת גם גרסת 0.3B קלה יותר שרצה מהר פי שניים, אבל הגרסה הזו מכוונת למקסימום יציבות ואיכות צליל, כולל תמיכה במבטאים צפוניים ודרומיים.

מתאים ל

  • עוזר קולי למכשירי קצה

    משקל של 1.1 גיגה מאפשר הטמעה על מכשירים מקומיים בווייטנאם ללא צורך בחיבור מתמיד לענן.

  • הקראת תוכן מותאמת אישית

    שכפול קול תוך שלוש שניות מאפשר להקריא כתבות או ספרים בקול מוכר בלי תהליך אימון ארוך.

  • שרת דיבור מקומי

    הרצה דרך תמונת דוקר ו־LMDeploy מספקת פתרון יעיל וחסכוני לעיבוד פניות קוליות באפליקציות.

איפה זה נופל

המודל תומך אך ורק בשפה הווייטנאמית. אין שום תמיכה בעברית, באנגלית או בכל שפה אחרת, ולכן לקהל ישראלי הוא רלוונטי רק למוצרים שמכוונים ספציפית לשוק הווייטנאמי. בנוסף, מודלים זעירים של דיבור עלולים להתקשות בשמירה על הגייה מדויקת של מילים שאולות או מונחים טכניים שלא נכללו במאגר האימון. שכפול קול של חמש שניות אומנם עובד מהר, אך איכותו תלויה לחלוטין ברמת הניקיון של קובץ המקור ואינה משתווה למודלים מסחריים כבדים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או באנגלית?

לא. המודל אומן על דאטה ייעודי בווייטנאמית בלבד ומזהה השפה שלו מוגדר לווייטנאמית. הזנת טקסט בעברית לא תייצר פלט תקין.

מה ההבדל בין מודל זה לגרסת ה־0.3B?

המודל הנוכחי מבוסס על NeuTTS Air ומתמקד ביציבות ואיכות קול גבוהה יותר. גרסת ה־0.3B אומנה מאפס ומספקת מהירות כפולה וזמן תגובה נמוך יותר על חשבון ירידה מסוימת באיכות.

איך מריצים

המודל שוקל 1.1 גיגה בייט בפורמט פאיטורץ', כך שהוא ירוץ בלי בעיה גם על כרטיס מסך בסיסי עם מעט זיכרון, ואפילו על מעבד רגיל. התקנה מקומית נעשית ישירות ממאגר הגיטהאב דרך כלי התלויות uv והפעלת ממשק ווב, או באמצעות חבילת פייתון ייעודית בשם vieneu. למי שרוצה ביצועים מקסימליים בייצור, יש אפשרות להרים שרת דוקר מוכן מראש שמריץ שרת LMDeploy ומאפשר חיבור מרחוק.

אם אתם צריכים להריץ המרות בודדות פעם ב, אין שום סיבה לתחזק שרת דוקר או חומרה משלכם, ועדיף להשתמש בפתרונות ענן. הריצה המקומית כאן משתלמת רק אם יש לכם צורך בעיבוד על המכשיר עצמו ללא חיבור רשת, או נפח עבודה רציף בווייטנאמית שמצדיק ניצול שרת עצמאי.

pip install -U huggingface_hub
hf download pnnbao-ump/VieNeu-TTS

הרישיון

המודל שוחרר תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗