GPT
K

kani-tts-2-en

קוד פתוח

nineninesixother2026-02-12

  • transformers
  • safetensors
  • lfm2
  • text-generation
  • text-to-speech

מודל הקראת טקסט קל משקל באנגלית שמכוון לשיחות חיות וזמן תגובה מהיר. הוא כולל יכולת מובנית לשכפול קול מקובץ שמע קצר ומסתפק בפחות מגיגה זיכרון בעבודה שוטפת.

  • 370Mפרמטרים
  • 128,000טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 636הורדות בחודש

מה זה

מדובר במודל הקראת טקסט שנבנה סביב תהליך של שני שלבים, שמשלב מודל שפה מבוסס LiquidAI LFM2 350M עם מקודד האודיו NanoCodec של אנבידיה. הפלט מופק בקצב דגימה של 22kHz, והארכיטקטורה משתמשת בקידודי מיקום ברמת הפריים כדי לאפשר דיבור שוטף בשיחה חיה. האימון התבסס על כעשרת אלפים שעות של שמע ממאגרי Emilia ו־EmoNet-Voice, באמצעות שמונה מאיצי H100 למשך שש שעות בלבד.

בבדיקות שפורסמו על גבי כרטיס RTX 5080, המודל מציג יחס זמן אמת של כ־0.2. זה אומר שהוא מייצר שנייה אחת של דיבור בחמישית שנייה בלבד, קצב שמתאים לחלוטין למערכות שדורשות מענה מיידי בלי השהיות מורגשות לאוזן. צריכת הזיכרון שנמדדה בכרטיס עומדת על 3GB VRAM בלבד, מה שמאפשר לדחוף אותו לצד מודלים נוספים בלי לחנוק את החומרה.

מתאים ל

  • בוטים קוליים לשיחה חיה

    זמן הפקה נמוך מאוד של חמישית שנייה מאפשר תגובה מיידית לדיבור של משתמש באנגלית.

  • שכפול קול למערכות מענה

    חילוץ מאפייני דובר מקובץ אודיו קיים בלחיצה אחת בלי לאמן את כל המודל מחדש.

  • הקראת הודעות קצרות

    משקל קל וצריכת זיכרון מזערית שמתאימים למשלוח התראות ומשפטים קצרים בשרתים מקומיים.

איפה זה נופל

הבעיה המרכזית שלו היא אורך הקלט. איכות הדיבור מתחילה לרדת בצורה מורגשת בקטעים שאורכים מעבר ל־40 שניות, כך שהוא ממש לא בנוי להקראת פרקים שלמים או מסמכים ארוכים ברצף. בנוסף, המודל אומן ומותאם כמעט בלעדית לאנגלית. מי שינסה להכניס לו טקסט בעברית לא יקבל תוצאה סבירה בלי לעשות אימון המשך מלא מאפס על בסיס נתונים מקומי. הכרטיס גם מציין במפורש שהפרוזודיה וההגייה נוטות לסחוב הטיות ממאגרי המידע המקוריים.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

לא. המודל הספציפי הזה אומן על אנגלית בלבד. כדי להפיק ממנו עברית צריך להשתמש בשלד האימון הפתוח שהמפתחים שחררו בגיטהאב, לאסוף דאטה מתאים, ולאמן אותו מחדש יחד עם התאמה למקודד NanoCodec.

מה החומרה המינימלית שנחוצה כדי לעבוד איתו?

כל כרטיס מסך מודרני עם 4GB זיכרון יספיק להרצה מקומית. בבדיקות המפתחים על כרטיס RTX 5080 הוא דרש כ־3GB VRAM, כך שמדובר בדרישות נמוכות מאוד שמאפשרות להריץ אותו בקלות גם על לפטופים ייעודיים לפיתוח.

איך מריצים

כדי להריץ אותו מתקינים את החבילה kani-tts-2 יחד עם גרסה 4.56.0 של transformers. הקבצים שוקלים 2.1 גיגה ומחולקים לעשרים ואחד חלקים, כך שכל כרטיס מסך מודרני עם לפחות 4GB VRAM יספיק פה בהחלט. הקוד פשוט מאוד, יוצרים אובייקט עם הנתיב, מעבירים מחרוזת, ומקבלים קובץ wav מוכן.

אם אתם צריכים שכפול קול, מוסיפים את SpeakerEmbedder מהחבילה ומחלצים וקטור מדגימת קול חיצונית בעזרת מודל wavLM של אורנג'. אפשר להרים אותו כמקודד מקומי או להשתמש במימוש שרת סטרימינג תואם OpenAI שהמפתחים שחררו, כך שאין שום סיבה לשלם לספק ענן חיצוני על קריאות API אם יש לכם מחשב מקומי פנוי.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="nineninesix/kani-tts-2-en")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, כלומר רישיון מותאם אישית ולא תקן חופשי פתוח כמו MIT או אפאצ'י. יוצרי המודל מפרטים מדיניות שימוש אחראי שאוסרת התחזות ללא הסכמה, פעילות זדונית והפצת תוכן פוגעני. לפני שמשלבים אותו במוצר מסחרי סגור, חובה לבדוק את התנאים המלאים במאגר הקוד בגיטהאב כדי לוודא שאין הגבלות נוספות על שימוש עסקי.

הרישיון המלא בעמוד המודל ↗