GPT
K

kitten-tts-nano-0.2

קוד פתוח

KittenMLapache-2.02025-08-20

  • kittentts
  • onnx

מודל הקראת טקסט זעיר ששוקל פחות מעשרים וחמישה מגה ויודע להפיק דיבור על מעבד רגיל. הוא פונה למי שצריך תשתית מקומית קלה במיוחד בלי להחזיק כרטיס מסך יקר.

  • 22.7 MBמשקל הקבצים
  • 8,258הורדות בחודש
  • 51לייקים

מה זה

מדובר במודל טקסט לדיבור בקוד פתוח עם 15 מיליון פרמטרים בלבד, שכל משקלו מסתכם ב־22.7 מגה-בייט בחמישה קבצים. המטרה המרכזית שלו היא לספק סינתזת קול באיכות טובה ישירות על מעבדים רגילים, בלי שום תלות בחומרה גרפית ייעודית ובלי להעמיס על הזיכרון של המכשיר.

הוא כולל שמונה קולות שונים, בחלוקה שווה בין קולות גבריים לנשיים, ומייצר אודיו בקצב דגימה של 24,000 הרץ. במקום להסתמך על מודלי ענק כבדים של מאות מגה-בייט או גיגה-בייטים, הוא מתוכנן לעבוד מהר מאוד ובזמן אמת על חומרה בסיסית ביותר, מה שהופך אותו לבחירה מעניינת לפיתוח שבו כל מגה-בייט קובע.

מתאים ל

  • הקראה במכשירים חלשים

    הוא שוקל פחות מ־25 מגה ולא דורש מאיץ גרפי, מושלם לחומרה מוגבלת.

  • מענה קולי מקומי בזמן אמת

    האינפרנס מהיר ומיועד להפקה ישירה בלי להוציא בקשות לרשת חיצונית.

  • אפליקציות שולחניות פשוטות

    אפשר לארוז אותו בקלות בתוך ההתקנה בלי לנפח את משקל הקבצים.

איפה זה נופל

המודל מוגדר כרגע בגרסת תצוגה מקדימה למפתחים, ומשקולות האימון המלאות שלו עדיין לא שוחררו לפי רשימת המשימות של היוצרים. ערכת פיתוח למובייל וגרסת רשת עדיין לא קיימות. מעבר לכך, כל הדוגמאות מציגות אנגלית בלבד, ואין שום תיעוד לתמיכה בעברית. לפני שמשלבים אותו במוצר אמיתי, חובה לבדוק אם הוא בכלל יודע להגות שפות נוספות ולוודא שאיכות הקול של מודל כל כך קטן מספקת אתכם.

שאלות
נפוצות

האם המודל עובד בעברית?

הכרטיס לא מזכיר תמיכה בשום שפה חוץ מאנגלית, והדוגמאות מציגות טקסט באנגלית בלבד. סביר להניח שהוא לא יתמודד עם עברית, ולכן צריך לבדוק אותו עצמאית לפני שבונים עליו לפרויקט מקומי.

האם חייבים כרטיס מסך כדי להפיק סאונד?

לא, המודל מותאם לחלוטין לעבודה על מעבד רגיל. הוא כולל 15 מיליון פרמטרים בלבד, כך שכל מעבד מודרני מריץ אותו בקלות ובמהירות בלי התקנות מורכבות של חומרת עיבוד גרפית.

איך מריצים

כדי להריץ אותו, מתקינים את חבילת kittentts ישירות מקובץ הגלגל בגיטהאב של הפרויקט, טוענים את המודל בפייתון ומעבירים לו את הטקסט יחד עם שם הקול הרצוי. את מערך האודיו שנוצר שומרים לקובץ בעזרת ספריית soundfile סטנדרטית בקצב של עשרים וארבעה קילו-הרץ.

מבחינת חומרה, המודל רץ ישירות על המעבד ולא צריך כרטיס מסך כלל, כך שאפשר להרים אותו על כל מחשב פשוט. אם אתם צריכים תמיכה רחבה בשפות מורכבות או איכות אולפן מושלמת, כנראה שעדיף לשלם על שירות ענן חיצוני, אבל לפעולות מקומיות בסיסיות אין צורך בשרתים מיוחדים.

pip install -U huggingface_hub
hf download KittenML/kitten-tts-nano-0.2

הקבצים

5 קבצים במאגר, 22.7 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר לכם להשתמש במודל, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים מסחריים או פרטיים, כל עוד אתם שומרים על הודעת הרישיון המקורית וציון זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗