GPT
K

KhanhTTS-OmniVoice

קוד פתוח

kjanhapache-2.02026-05-16

  • safetensors
  • omnivoice
  • text-to-speech
  • vi
  • en

מודל המרת טקסט לדיבור מבוסס OmniVoice שמתמחה בווייטנאמית ובאנגלית. הוא מיועד למי שמחפש שכפול קול מהיר מקובץ דגימה קצר בשפות האלו.

  • 613Mפרמטרים
  • 3.0 GBמשקל הקבצים
  • 2,577הורדות בחודש
  • 38לייקים

מה זה

מדובר בהתאמה ייעודית של OmniVoice שאומנה על כ־1,500 שעות של הקלטות בווייטנאמית ובאנגלית לאורך כ־500 אלף צעדים. המטרה המרכזית כאן היא היגוי טבעי בשתי השפות האלו לצד שכפול קול יציב, כזה שלא דורש דגימות קול ארוכות כדי לתפוס את גוון הדיבור.

בגודל של כ־613 מיליון פרמטרים, הוא מפיק אודיו בקצב דגימה של 24kHz ישירות למערך נתונים. במקום לנסות לכסות עשרות שפות בצורה שטחית, המפתח מיקד את כל משקל האימון בצמד השפות הזה, מה שהופך אותו לפתרון ממוקד מאוד ביחס למודל הבסיס הכללי.

מתאים ל

  • שכפול קול בווייטנאמית

    הפקת דיבור בקול מותאם אישית מקובץ ייחוס קצר, עם היגוי שתוכנן ספציפית לווייטנאמית.

  • מערכות דיבור באנגלית

    הרצה מקומית של מודל קל יחסית שמייצר אודיו באיכות 24kHz בלי עלויות של ספקי ענן חיצוניים.

  • מחקר על ארכיטקטורת OmniVoice

    בדיקה והשוואה של התאמת מודל דיפוזיה קולי על דאטה-סט ממוקד של 1,500 שעות.

איפה זה נופל

החיסרון הברור ביותר הוא השפות. הוא תומך אך ורק בווייטנאמית ובאנגלית, ואין לו שום תמיכה בעברית או בשפות אחרות, כך שלמוצר ישראלי מקומי הוא פשוט לא רלוונטי. מעבר לזה, המפתח עצמו מדגיש בפירוש שהמודל נועד למחקר ולניסויים ואינו מומלץ לשימוש בסביבת ייצור מסחרית ללא בדיקות מקיפות והערכת סיכונים. הכרטיס לא מציג ציוני בדיקה מסודרים או מדדי איכות אובייקטיביים, כך שתצטרכו להקשיב לדוגמאות בעצמכם כדי לבדוק יציבות.

שאלות
נפוצות

האם המודל מסוגל לדבר בעברית?

לא. המודל אומן אך ורק על וייטנאמית ואנגלית, והוא לא יזהה או יקריא טקסט בעברית.

כמה זמן של הקלטת ייחוס צריך כדי לשכפל קול?

האימון כוון במפורש לעבוד עם דגימות קצרות. כפי שמוצג בקוד ההרצה, מספיק משפט בודד של כמה שניות יחד עם התמלול שלו כדי להתחיל לייצר אודיו בקול המבוקש.

האם אפשר להטמיע אותו במוצר מסחרי?

מבחינת רישיון apache-2.0 זה מותר חוקית, אך היוצר פרסם הסתייגות מפורשת שממליצה לא להשתמש בו בייצור מסחרי בלי בדיקות בטיחות והתאמה קפדניות משלכם.

איך מריצים

ההרצה נעשית באמצעות ספריית omnivoice בפייתון, בטעינה ישירה לכרטיס מסך עם דיוק float16 דרך ספריית torch. עם משקל קבצים של 3.0 ג'יגה-בייט, אפשר להריץ אותו בקלות על כרטיס מסך ביתי מודרני עם לפחות 6 עד 8 ג'יגה-בייט של זיכרון ייעודי, בלי צורך בחומרת שרתים יקרה.

הקריאה פשוטה מאוד ומקבלת טקסט ודגימת קול לייחוס יחד עם התמלול שלה, ופולטת קובץ wav דרך soundfile. אם אתם צריכים רק שירות מזדמן באנגלית בלי לגעת בווייטנאמית, קריאה ל־API מסחרי מוכן תחסוך לכם תחזוקת שרת, אבל להרצה מקומית בחינם הוא יושב בנוחות על מכונה בסיסית.

pip install -U huggingface_hub
hf download kjanh/KhanhTTS-OmniVoice

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם מצרפים עותק של הרישיון והודעת זכויות יוצרים. יחד עם זאת, תיאור המודל כולל הסתייגות משפטית של היוצר שמבקשת להימנע משימוש בסביבת ייצור או יישומים מסחריים ללא בדיקה קפדנית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗