GPT
S

supertonic-3

קוד פתוח

Supertoneopenrail2026-05-06

  • supertonic
  • onnx
  • text-to-speech
  • speech-synthesis
  • tts

מודל המרת טקסט לדיבור קל משקל שרץ מקומית על המכשיר בלי שרת חיצוני. מתאים למי שצריך תמיכה ב־31 שפות עם זמני תגובה מהירים על מעבד רגיל.

  • 396 MBמשקל הקבצים
  • 29,748הורדות בחודש
  • 948לייקים

מה זה

המודל מגיע עם כ־99 מיליון פרמטרים ומשקל קבצים כולל של 396 מגה-בייט, ומיועד להפקת דיבור ישירות על חומרת הקצה דרך ONNX Runtime. בניגוד למודלי ענק בתחום שמגיעים למאות מיליוני פרמטרים או יותר, המיקוד כאן הוא צריכת זיכרון נמוכה וריצה מקומית מלאה ללא תלות ברשת.

הגרסה הזו מרחיבה את התמיכה ל־31 שפות, ביניהן אנגלית, ערבית, יפנית, קוריאנית ורוסית, אך ללא עברית. לפי נתוני היוצרים, המודל משפר את יציבות הקריאה ביחס לגרסה הקודמת עם פחות דילוגים וחזרות על מילים במשפטים קצרים וארוכים, תומך בתגיות הבעה בסיסיות כמו צחוק או נשימה, ומציג דיוק קריאה שנמדד בערכי שגיאת מילים ותווים קרובים למודלים כבדים בהרבה.

מתאים ל

  • הקראת טקסט על מכשירי קצה

    משקל קטן של פחות מ־400 מגה-בייט מאפשר הרצה ישירה בטלפון או בטאבלט ללא חיבור אינטרנט.

  • דיבוב דמויות למשחקים

    תמיכה בתגיות הבעה קוליות כמו צחוק או אנחה וריצה חסכונית שאינה מעמיסה על המעבד.

  • מענה קולי במוקדי שירות

    זמני תגובה מהירים על מעבד רגיל שמתאימים למערכות שיחה באנגלית ובשפות נוספות.

איפה זה נופל

החיסרון המרכזי למפתח הישראלי הוא היעדר מוחלט של תמיכה בשפה העברית מתוך 31 השפות הנתמכות. ערבית אמנם קיימת, אבל עברית לא ברשימה ולכן הוא לא מתאים לפרויקטים מקומיים בלבד.

בנוסף, שכפול קול חדש אינו פתוח לחלוטין. החבילה מספקת קולות מובנים קבועים, ומי שרוצה להפיק קול מותאם אישית מאודיו חיצוני מופנה לכלי חיצוני בתשלום. חובה לבדוק היטב את תגיות ההבעה לפני שילוב באוטומציה, כי השליטה בסגנון מוגבלת מאוד.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי להקריא טקסטים בעברית?

לא. המודל תומך ב־31 שפות כולל ערבית, אנגלית, רוסית וגרמנית, אך עברית אינה נכללת ברשימת השפות הנתמכות שלו.

האם חייבים כרטיס מסך מסוג אנבידיה כדי להריץ אותו במוצר?

אין צורך ב־GPU כלל. המודל בנוי לרוץ על גבי ONNX Runtime ישירות על המעבד המרכזי עם צריכת זיכרון מינימלית.

האם אפשר לשכפל קול של משתמש ישירות מתוך הקוד החופשי?

הקוד מגיע עם קולות מוכנים מראש בלבד. כדי להפיק ייצוג קול חדש מאודיו קיים תצטרכו להשתמש בכלי המקוון של החברה.

איך מריצים

ההרצה פשוטה מאוד. מתקינים את ספריית supertonic בפיפ, טוענים את המחלקה בתוך פייתון והמודל מוריד את הקבצים אוטומטית בהרצה הראשונה. הוא רץ על גבי ONNX Runtime ולכן אין שום צורך בכרטיס מסך ייעודי, מעבד סטנדרטי במחשב אישי או במכשיר קצה מספיק כדי לקבל זמני תגובה טובים.

אם אתם צריכים ייצור קולות מותאמים אישית מאפס, המודל הפתוח כולל רק פרופילי קול מוכנים מראש. כדי ליצור פרופיל מקובץ שמע שלכם צריך להשתמש בשירות הרשת בתשלום של החברה, ובמצב כזה שווה לשקול אם בכלל להחזיק תשתית עצמאית.

pip install -U huggingface_hub
hf download Supertone/supertonic-3

הרישיון

הקוד לדוגמה משוחרר ברישיון MIT, אך משקלי המודל מופצים תחת רישיון OpenRAIL-M. הרישיון מאפשר שימוש מסחרי, אך כולל מגבלות שימוש ספציפיות שאוסרות על יישומים מזיקים כמו הונאה או התחזות, ומחייב אתכם להעביר את אותן המגבלות הלאה אם אתם מפיצים את המודל בתוך מוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗