GPT
K

kani-tts-370m

קוד פתוח

nineninesixother2025-09-30

  • transformers
  • safetensors
  • lfm2
  • text-generation
  • text-to-speech

מודל דיבור קטן במיוחד שמייצר אודיו במהירות גבוהה ובצריכת זיכרון מינימלית. הוא מתאים למי שרוצה להריץ קולות בזמן אמת בלי להחזיק כרטיסי מסך יקרים.

  • 370Mפרמטרים
  • 128,000טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 333הורדות בחודש

מה זה

מדובר במודל טקסט לדיבור בגודל 370 מיליון פרמטרים שמבוסס על שלד ה־LFM2 של LiquidAI בשילוב NanoCodec של Nvidia לעיבוד גלי הקול. הוא מאומן על כ־80 אלף שעות דיבור וכולל 15 דוברים מובנים בשפות כמו אנגלית, ערבית, גרמנית, ספרדית, סינית וקוריאנית, בקצב דגימה של 22kHz. עברית אין כאן בכלל.

בבדיקות שלהם על כרטיס RTX 5080, הוא מפיק 15 שניות של אודיו בתוך כשנייה אחת, עם צריכת זיכרון של 2GB VRAM בלבד. המדדים מציגים ציון MOS של 4.3 ושיעור שגיאות WER נמוך מחמישה אחוזים. בפועל, זה אומר שההגייה מדויקת והצליל נשמע טבעי רוב הזמן, אבל השפה העיקרית שלו היא אנגלית, ושאר השפות עשויות להישמע פחות מהוקצעות.

מתאים ל

  • עוזר קולי בזמן אמת

    זמן הפקה של שנייה אחת ל־15 שניות אודיו מאפשר תגובה שמרגישה מיידית בשיחה.

  • בוט שיחות בערבית

    כולל שני דוברים מובנים בערבית ואפשרות להרצה על שרתים זולים עם 2GB VRAM בלבד.

  • הקראת טקסט מקומית במכשיר

    משקל קובץ של 1.4GB מתאים להטמעה ישירה ללא תלות בחיבור רשת או בתשלום לפי קריאה.

איפה זה נופל

הביצועים מידרדרים בטקסטים שעוברים 2000 טוקנים, וללא כוונון נוסף חסרה לו הבעה רגשית מורכבת. הוא גם סוחב הטיות מההקלטות שעליהן אומן, שמשפיעות על האינטונציה. מעבר לכך, האופטימיזציה כוונה בעיקר לאנגלית. ערבית אמנם נתמכת עם שני קולות, אבל עברית נעדרת לחלוטין מהחומר.

שאלות
נפוצות

האם המודל יודע להקריא טקסט בעברית?

לא. המודל תומך באנגלית, גרמנית, סינית, קוריאנית, ערבית וספרדית בלבד. ניסיון להזין לו טקסט בעברית לא יעבוד ללא אימון והרחבה ייעודיים.

איזה כרטיס מסך צריך כדי לקבל זמני תגובה טובים?

המודל צורך רק 2GB של זיכרון מסך, כך שכרטיס מודרני סטנדרטי יספיק. המפתחים בדקו אותו על RTX 5080, אבל המשקל הנמוך מאפשר להריץ אותו בקלות גם על חומרה חלשה בהרבה.

איך מריצים

ההרצה דורשת התקנה של חבילת kani-tts וגרסת transformers 4.57.1 ספציפית כדי לתמוך בארכיטקטורת LFM2. בגלל המשקל הקל של 1.4 גיגה בייט, אפשר להריץ אותו מקומית על כמעט כל כרטיס מסך בסיסי עם 2GB זיכרון פנוי, או במעבד אם לא לחוצים על מהירות.

אם אתם צריכים רק אנגלית או אחת השפות הנתמכות בשביל בוט קולי פשוט, ההרצה המקומית פשוטה מאוד ולא מצדיקה תשלום לפי דקה לענן. אם הדרישה היא איכות שידור אולפנית, עברית, או מגוון רחב של רגשות, עדיף לפנות למודלים מסחריים מבוססי API.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="nineninesix/kani-tts-370m")
print(pipe("שלום"))

הרישיון

בכרטיס המודל מופיע תג של Apache 2.0 שמתיר שימוש מסחרי חופשי, אך בשדה המטא־דאטה הרשמי נרשם other. יש לבדוק היטב את תנאי הקוד של kani-tts לפני שילובו במוצר, במיוחד לאור הגבלות שימוש מפורטות על יצירת תוכן אסור, הונאה או התחזות.

הרישיון המלא בעמוד המודל ↗