GPT
S

supertonic-2

קוד פתוח

Supertoneopenrail2026-01-06

  • supertonic
  • onnx
  • text-to-speech
  • speech-synthesis
  • tts

מודל המרת טקסט לדיבור זעיר שמכוון ישירות לריצה מקומית על מכשירי קצה. הוא מייצר אודיו בקצב מהיר במיוחד ובלי תלות בשרתים חיצוניים.

  • 256 MBמשקל הקבצים
  • 1,113הורדות בחודש
  • 397לייקים

מה זה

מדובר במודל טקסט לדיבור עם 66 מיליון פרמטרים בלבד, ששוקל כמאתיים חמישים מגה בייט. הדור השני מוסיף תמיכה בחמש שפות: אנגלית, קוריאנית, ספרדית, פורטוגזית וצרפתית. המבנה מבוסס על ONNX Runtime, והוא נבנה מהיסוד לפעול ישירות על מעבדי מכשירים אישיים ללא צורך בענן.

בבדיקות הביצועים של היוצרים נמדד פקטור זמן אמת של עד 0.001 על כרטיס RTX4090, וסביב 0.012 על מעבד M4 Pro. המשמעות המעשית היא יצירת שעה של אודיו בפחות מדקה. המודל עוקף משמעותית זמני תגובה של שירותי רשת כמו ElevenLabs או OpenAI, פשוט כי אין השהיית תקשורת והחישוב קל מאוד.

מתאים ל

  • הקראה מקומית באפליקציות

    משקל של 256 מגה בייט וריצה מהירה על מעבד רגיל מתאימים לטלפונים ומחשבים אישיים ללא חיבור רשת.

  • עוזרים קוליים בדפדפן

    תמיכה ב־WebGPU מאפשרת יצירת תגובה קולית מיידית ישירות אצל המשתמש באנגלית או ספרדית.

  • מענה קולי במערכות משובצות

    צריכת משאבים נמוכה בזכות 66 מיליון פרמטרים מאפשרת הפקת אודיו מהירה על חומרה צנועה.

איפה זה נופל

החיסרון המרכזי למשתמש הישראלי הוא היעדר מוחלט של תמיכה בעברית. המודל מוגבל לחמש השפות שהוגדרו מראש, כך שאי אפשר להשתמש בו ליישומים מקומיים בארץ. בנוסף, פסיפס ביצועים של שני צעדי דגימה עלול לפגוע בטבעיות של הדיבור לעומת מודלים כבדים, ונדרשת בדיקה ידנית של איכות הצליל לפני שילוב בתעבורה חיה.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל תומך כרגע באנגלית, קוריאנית, ספרדית, פורטוגזית וצרפתית בלבד. טקסט בעברית לא יעבוד כאן.

האם חייבים כרטיס מסך חזק כדי לקבל זמני תגובה טובים?

אין צורך בכרטיס מסך ייעודי. המודל תוכנן לעבוד על גבי ONNX Runtime ומציג פקטור זמן אמת נמוך מאוד גם על מעבדי מחשב נייד רגילים.

איך מריצים

ההרצה המקומית מתבצעת בעזרת ספריית supertonic הרשמית וסביבת ONNX Runtime, מה שמאפשר שימוש גם דרך WebGPU בדפדפן וגם ישירות על גבי ה־CPU. בזכות משקל של 256 מגה בייט, אין צורך בחומרת שרתים יקרה או בכרטיס מסך ייעודי כדי לקבל קצב דיבור שוטף.

אפשר לבחור בין שני צעדי דגימה לחמישה צעדים, כאשר שני צעדים מספקים מהירות מקסימלית וחמישה צעדים דורשים מעט יותר כוח עיבוד. מעבר ל־API מסחרי מוצדק רק אם אתם חייבים שפות שאינן נתמכות כאן או איכות קול ספציפית שדורשת מודלי ענק.

pip install -U huggingface_hub
hf download Supertone/supertonic-2

הרישיון

המודל מופץ תחת רישיון OpenRAIL-M, ואילו קוד הדוגמה מופץ ברישיון MIT. רישיון OpenRAIL מתיר שימוש מסחרי, אך כולל מגבלות שימוש שמטרתן למנוע פגיעה, זיוף קול לא מורשה או הטעיה. אם אתם משלבים אותו במוצר, עליכם לוודא שהשימוש שלכם אינו מפר את תנאי הרישיון הללו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗