GPT
K

kugelaudio-0-open

קוד פתוח

kugelaudiomit2026-01-11

  • safetensors
  • kugelaudio
  • text-to-speech
  • tts
  • speech-synthesis

הפקת דיבור בקוד פתוח שמתמקדת בשפות אירופאיות. הוא מיועד למי שצריך קריינות טבעית בגרמנית, צרפתית או ספרדית ולא רוצה לשלם על שירותי ענן מסחריים.

  • 9.3Bפרמטרים
  • 17.4 GBמשקל הקבצים
  • 2,615הורדות בחודש
  • 199לייקים

מה זה

מדובר במודל טקסט לדיבור שנשען על ארכיטקטורת VibeVoice של מיקרוסופט, עם בסיס שפה של Qwen2.5 בנפח 7 מיליארד פרמטרים וראש דיפיוז'ן של עשרים צעדים שמייצר אודיו בקצב של 24kHz. הוא אומן על כמאתיים אלף שעות דיבור ממאגר YODAS2, תוך דגש על שפות אירופאיות שבדרך כלל מקבלות פחות תשומת לב בכלים פתוחים.

במבחן העדפה אנושי של 339 השוואות בגרמנית, המודל ניצח שירותים מסחריים מוכרים כמו ElevenLabs, עם ציון OpenSkill של 26 לעומת 25 ושיעור ניצחונות של 78 אחוזים. המדידה כללה סגנונות מורכבים כמו צעקה, שירה, שכרות ולחישה, כך שהיתרון שלו מתבטא בהבעת רגש ולא רק בהקראת חדשות יבשה.

מתאים ל

  • דיבוב תוכן בגרמנית וצרפתית

    איכות השמע בשפות האלו עוקפת שירותים מסחריים ומאפשרת הפקת אודיו עשיר ברגש.

  • הקראת ספרים ופודקאסטים

    פרופילי הקול המובנים מאפשרים מעבר בין סגנונות כמו לחישה וקריינות רדיו ללא עלות ענן.

  • עוזרים קוליים באירופה

    פתרון מלא בהרצה עצמית שמספק מענה קולי מקומי בלי להוציא מידע מחוץ לתשתית הארגון.

איפה זה נופל

עברית בכלל לא ברשימת השפות הנתמכות, כך שהכלי הזה חסר תועלת לחלוטין לפרויקטים מקומיים שמכוונים לקהל בארץ. מעבר לכך, היוצרים מבהירים שאיכות הפלט משתנה מאוד בין שפות, ורמה גבוהה מובטחת בעיקר באנגלית, גרמנית, ספרדית וצרפתית. הגרסה הפתוחה הזו מוגבלת רק לפרופילי קול מקודדים מראש שמגיעים איתה, ואינה תומכת בשכפול קול מקבצי אודיו חיצוניים. בנוסף, כל קובץ שנוצר כולל חותמת מים סמויה בטכנולוגיית AudioSeal.

שאלות
נפוצות

האם המודל תומך בדיבור בעברית?

לא. רשימת השפות כוללת שפות אירופאיות בלבד, כמו גרמנית, אנגלית, ספרדית, צרפתית ופולנית. טקסט בעברית לא יופק כשורה ולא מיוצג באימוני המודל.

האם אפשר לשכפל קול מדגימת אודיו קצרה?

לא בגרסה הזו. המודל הפתוח עובד אך ורק עם קובצי קול מוכנים מראש שמגיעים כחלק מההפצה, ויכולת שיבוט הקול לא שוחררה לשימוש חופשי.

איך מריצים

בשביל להריץ אותו עצמאית תצטרכו כרטיס מסך עם לפחות 19GB של זיכרון וידאו, מה שדורש חומרה מקצועית ייעודית. אפשר לחסוך מעט זיכרון באמצעות קריאה לפונקציה הייעודית שמסירה חלק מרכיבי הקידוד. ההתקנה מתבצעת דרך pip או uv בחבילה הייעודית של הפרויקט, וההרצה דורשת פייתון 3.10 ומעלה.

מבחינת מהירות, המודל מייצר אודיו בקצב של פי אחד מזמן אמת על מעבדים גרפיים מודרניים. אם היישום שלכם דורש מענה מיידי של פחות ממאה מילישניות או שאין לכם כרטיסי מסך חזקים בשרת, תצטרכו לפנות לשירות ה־API המנוהל של המפתחים במקום להחזיק תשתית כבדה משלכם.

pip install -U huggingface_hub
hf download kugelaudio/kugelaudio-0-open

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗