GPT
O

OmniVoice

קוד פתוח

k2-fsaרישיון לא דווח2026-03-30

  • omnivoice
  • safetensors
  • zero-shot
  • multilingual
  • voice-cloning

הפיכת טקסט לדיבור עם תמיכה ביותר מ־600 שפות ושכפול קול מקטע קצר. קל משקל, מהיר מאוד בריצה מקומית, ומתאים למי שחייב מגוון שפות עצום בקובץ יחיד.

  • 613Mפרמטרים
  • 3.0 GBמשקל הקבצים
  • 1,153,331הורדות בחודש
  • 1,363לייקים

מה זה

מדובר במודל המרת טקסט לקול מבוסס ארכיטקטורת דיפיוז'ן שפתית, עם כ־613 מיליון פרמטרים בלבד. הוא מתמחה בייצור דיבור בשיטת אפס דוגמאות מתוך קטע שמע קצר, לצד שליטה במאפייני הקול כמו גיל, מגדר, מבטא, לחישה והוספת סממנים לא קוליים כמו צחוק.

הייחוד המרכזי מול פתרונות אחרים במשקל הזה הוא השילוב בין מנעד עצום של יותר מ־600 שפות לבין מהירות עבודה גבוהה. נתון זמן הריצה שלו עומד על 0.025 RTF, שזה פי 40 מהר יותר ממהירות דיבור אמיתית, מה שהופך יצירת אודיו ארוך לכמעט מיידית גם בלי שרתים מנופחים.

מתאים ל

  • שכפול קול מקומי ומהיר

    יצירת קריינות מותאמת אישית מדגימה קצרה פי 40 מזמן אמת, בלי לשלוח שמע לשרתים חיצוניים.

  • פרויקטים בלשניים ורב-לשוניים

    עבודה מול קהלים בעולם במאות שפות ודיאלקטים נדירים מתוך מודל בודד וקל משקל.

  • עיצוב דמויות למשחקים

    שליטה בגיל, מגדר, מבטאים ולחישות לבניית קולות מגוונים בהרצה פנימית במחשב.

איפה זה נופל

למרות ההבטחה למאות שפות, רשימת התגיות הרשמית בעמוד כוללת בעיקר שפות נדירות מאוד ואין אזכור מפורש לאיכות העברית, כך שחובה לבדוק אותה ידנית לפני שמתכננים עליו. בנוסף, שכפול קול דורש לספק גם את קובץ האודיו וגם את התמלול המדויק שלו, מה שמוסיף שלב מציק של זיהוי דיבור אם אין לכם טקסט מוכן מראש.

שאלות
נפוצות

אפשר להשתמש בו במוצר מסחרי?

הקוד עצמו ברישיון חופשי, אבל המשקלים מוגבלים לשימוש לא מסחרי. למוצר שמכניס כסף תצטרכו לחפש פתרון אחר או לקבל אישור מיוחד.

צריך שרת יקר בשביל להריץ אותו?

ממש לא. הוא שוקל שלושה גיגה בייט בלבד ורץ מצוין על כרטיס מסך בסיסי או מחשב מק עם אפל סיליקון.

איך עובד שכפול הקול בפועל?

מעבירים למודל קובץ שמע קצר יחד עם הטקסט שנאמר בו, והוא מייצר את הטקסט החדש באותו גוון דיבור ובאיכות גבוהה של עשרים וארבעה קילו הרץ.

איך מריצים

המשקל הכולל יושב על שלושה גיגה בייט, כך שכרטיס מסך ביתי רגיל עם שמונה גיגה זיכרון יעשה את העבודה בלי בעיה, והוא נתמך גם על מעבדי אפל סיליקון. ההרצה דורשת התקנה של פייתורץ' וחבילת הפייתון הייעודית שלו, והטעינה נעשית בפקודה אחת פשוטה בחצי דיוק.

אם אתם צריכים רק אנגלית ורוצים אפס התעסקות בתחזוקה, שירותי ענן חיצוניים יחסכו לכם שרתים. הפעלה עצמית שלו שווה את זה ברגע שחייבים שפות נידחות, פרטיות מלאה של קבצי הקול, או ייצור מקומי בהיקפים גדולים בלי לשלם לפי דקת שמע.

pip install -U huggingface_hub
hf download k2-fsa/OmniVoice

הרישיון

הקוד פתוח תחת אפאצ'י שתיים, אבל משקלי המודל עצמם סגורים לשימוש לא מסחרי בלבד בגלל מגבלות של מאגרי האימון. אם אתם בונים מוצר בתשלום או כלי מסחרי לחברה, אסור לכם להשתמש בו ישירות בלי לפתור את סוגיית הרישוי מול המפתחים.

הרישיון המלא בעמוד המודל ↗