GPT
V

ViiTorVoice-NAR

קוד פתוח

ZzWaterapache-2.02026-06-09

  • onnx
  • safetensors
  • Text-to-Speech
  • TTS
  • speech-edit

מודל דיבור לא אוטורגרסיבי שמתמקד בשכפול קול, עריכת קטעי אודיו נקודתיים ושליטה ברגש. הוא מפרק את התהליך לכמה רכיבים כדי לאפשר החלפה של מילים בודדות בהקלטה קיימת.

  • 10.8 GBמשקל הקבצים
  • 64הורדות בחודש
  • 137לייקים

מה זה

מדובר במערך רכיבים שמייצר דיבור בגישה שאינה אוטורגרסיבית, ומחולק לחלקים עצמאיים. יש כאן שילוב בין מודל שפה בגודל 0.6B שמייצר טוקנים של דיבור לפי תגיות רגש ומסכות עריכה, לבין רכיב יישור טקסט ואודיו מבוסס Qwen3 Forced Aligner, רכיב DualCodec להמרת גלי קול לטוקנים ובחזרה, ומודל W2V-BERT 2.0 לחילוץ מאפיינים סמנטיים.

הייחוד פה הוא היכולת לעשות עריכת דיבור מקומית. במקום לייצר משפט שלם מחדש כשרוצים לשנות מילה, מיישרים את האודיו לטקסט בעזרת זמנים מדויקים ומחליפים רק את המקטע הנדרש, תוך שמירה על הקול והיציבות של שאר ההקלטה.

מתאים ל

  • עריכת פודקאסטים והקלטות

    תיקון מילים בודדות בתוך הקלטה קיימת בלי להקליט מחדש ובלי לשנות את שאר המשפט.

  • שכפול קול עם הבעות

    יצירת דיבור בקול מותאם אישית תוך שליטה בתגיות רגש ומאפיינים קוליים.

  • יישור טקסט לקול

    הפקת חותמות זמן מדויקות לחיבור בין קובץ אודיו לתמליל שלו.

איפה זה נופל

המודל תומך רק בארבע שפות: אנגלית, סינית, יפנית וקוריאנית. עברית לא נתמכת כאן בכלל, ולא תעבוד ללא אימון נוסף והתאמות עמוקות.

מורכבות התפעול גבוהה כי לא מדובר בקובץ משקלים יחיד. כל תקלה בתיאום בין רכיב היישור, חילוץ המאפיינים והקודק תפגע בתוצאה הסופית של האודיו.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן ותומך רשמית באנגלית, סינית, יפנית וקוריאנית בלבד.

אפשר להוריד רק חלק מהרכיבים?

הקבצים מחולקים לפי תפקידים, אך הפונקציונליות המלאה כמו עריכה מקומית מחייבת את כל הרכיבים יחד, כולל מודל היישור והקודק.

איך מריצים

ההורדה כוללת 10.8 GB שמחולקים לתיקיות ייעודיות לכל רכיב. כדי להריץ את זה צריך לשמור במדויק על מבנה התיקיות שהוגדר בריפו של הפרויקט, אחרת קוד הטעינה נכשל.

בגלל שההרצה דורשת טעינה של כמה מודלים נפרדים לזיכרון בו זמנית, כולל רכיב הקידוד ומודל היישור, צריך כרטיס מסך עם מספיק זיכרון וידאו שיכול להחזיק את כולם יחד. אם אתם צריכים רק הקראת טקסט בסיסית בלי עריכה או שליטה ברגש, סביר להניח ששירות קיים יהיה פשוט יותר לתחזוקה.

pip install -U huggingface_hub
hf download ZzWater/ViiTorVoice-NAR

הקבצים

35 קבצים במאגר, 10.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים. עם זאת, היוצרים מציינים שיש לבדוק את תנאי הרישיון של כל תת מודל בנפרד לפני שילוב במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗