GPT
S

supertonic

קוד פתוח

Supertoneopenrail2025-11-18

  • supertonic
  • onnx
  • text-to-speech
  • en

מודל הקראת טקסט קל במיוחד של 66 מיליון פרמטרים, שמיועד לריצה מקומית מלאה על המכשיר. הוא מתאים למי שצריך תגובה מיידית בלי תלות ברשת ובלי לשלם לפי קריאה.

  • 255 MBמשקל הקבצים
  • 1,361הורדות בחודש
  • 486לייקים

מה זה

מדובר במודל טקסט לקול קטן ששוקל 255 מגה בייט בלבד ומבוסס על ONNX Runtime. הוא מיועד לעבוד ישירות על מעבדי מכשירי קצה, בדפדפן דרך WebGPU או מקומית באפליקציות, ומפיק קובצי WAV של 16 ביט. המודל יודע להתמודד ישירות עם מספרים, תאריכים, מטבעות וקיצורים בלי שצריך לנקות או לעבד את הטקסט קודם לכן.

מבחני הביצועים מראים פער עצום במהירות מול מודלים פתוחים אחרים כמו Kokoro וגם מול שירותי ענן. בהרצה של שני צעדים על שבב M4 Pro, המודל הגיע לערך RTF של 0.006 ב־WebGPU וקצב של עד 2,509 תווים לשנייה בטקסט ארוך. המשמעות בפועל היא שהאודיו נוצר בחבריר שנייה לעומת משך הדיבור שלו, מה שמאפשר השמעה כמעט חסרת השהיה גם על חומרה צרכנית רגילה.

מתאים ל

  • הקראה בדפדפן בלי שרת

    הרצה ישירה בצד הלקוח עם WebGPU, שחוסכת תעבורת רשת ושומרת על פרטיות מלאה.

  • אפליקציות מובייל מקומיות

    שילוב קל ב־iOS ואנדרואיד דרך פלאטר או סוויפט, לדיבור מיידי ללא חיבור אינטרנט.

  • מענה קולי במערכות משובצות

    משקל של 255 מגה בייט וצריכת מעבד נמוכה שמתאימים למחשבים קטנים ומכשירי קצה.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפה. המודל תומך כרגע באנגלית בלבד, כך שהוא לא יעזור למי שמחפש פתרון בעברית. בנוסף, המפתחים מציינים שהרצה על GPU דרך ONNX כלל לא נבדקה, ומדידות ה־RTX4090 בוצעו על גרסת PyTorch בלבד. גם בקרת האיכות דורשת בדיקה, שכן הקרבה של שני צעדי דגימה אמנם מהירה מאוד, אך עלולה לייצר פשרות בדיוק הקולי מול ריצה של חמישה צעדים או מול מודלי ענק.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקריאת טקסט בעברית?

לא. המודל אומן ותומך רשמית באנגלית בלבד. אם תזינו לו טקסט בעברית הוא ייכשל או ישתבש לחלוטין.

האם חובה להחזיק כרטיס מסך כדי לקבל ביצועים טובים?

ממש לא. המודל עבר אופטימיזציה מפורשת לריצה על מעבדים רגילים, ומציג מהירות גבוהה פי כמה מזמן אמת גם על מעבד צרכני פשוט.

איך מריצים

המודל פועל דרך ONNX Runtime ואין צורך במעבד גרפי כבד כדי להריץ אותו. משיכת הקבצים נעשית ממאגר הגיט עם Git LFS, והקוד כולל ספריות מוכנות לרוסט, פייתון, נוד, גו, סוויפט, סי שארפ, פלאטר ועוד. הוא מתוכנן לעבוד מצוין על מעבד מרכזי רגיל או בדפדפן, כך שכל לפטופ מודרני מריץ אותו בקלות.

אם אתם צריכים רק להקריא טקסט במכשיר של המשתמש או בשרת פנימי קטן, אין שום סיבה לשלם ל־API חיצוני. כדאי לפנות לשירות ענן רק אם אתם חייבים חיקוי קול מתקדם, עשרות שפות מורכבות או יכולות רגשיות מורכבות שכרגע לא קיימות במודל של 66 מיליון פרמטרים.

pip install -U huggingface_hub
hf download Supertone/supertonic

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקלי המודל עצמם מופצים ברישיון OpenRAIL-M. הרישיון מאפשר שימוש מסחרי, אך כולל מגבלות שימוש אתיות שמחייבות אתכם לא להשתמש במודל לפעולות מזיקות, התחזות אסורה או הטעיה, ועליכם להעביר את תנאי הרישיון הלאה בהפצה ללקוחות.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗