GPT
S

Soprano-1.1-80M

קוד פתוח

ekwekapache-2.02026-01-14

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • text-to-speech

מודל דיבור קטן במיוחד שמייצר אודיו במהירות גבוהה ובצריכת זיכרון מינימלית. הוא מתאים למי שרוצה להריץ המרת טקסט לקול מקומית על מעבד רגיל או מאיץ חלש בלי להסתמך על שירותי ענן.

  • 80Mפרמטרים
  • 1,024טוקנים בהקשר
  • 271 MBמשקל הקבצים
  • 51,485הורדות בחודש

מה זה

מדובר במודל המרת טקסט לדיבור שמבוסס על ארכיטקטורת שפה ומכיל כמעט שמונים מיליון פרמטרים בלבד. הוא מייצר שמע בקצב דגימה של 32kHz, ומסוגל להזרים סאונד בזמן השהיה נמוך מאוד של פחות מחמש עשרה מילישניות על כרטיס מסך, או פחות מרבע שנייה על מעבד מרכזי רגיל. לפי נתוני הפיתוח, מהירות היצירה מגיעה עד פי עשרים מזמן אמת על מעבד ועד פי אלפיים על מאיץ גרפי, תוך פיצול אוטומטי של טקסטים ארוכים.

גרסה 1.1 מציגה שיפור מורגש מול הגרסה הראשונה של שמונים מיליון פרמטרים שיצאה חודש קודם. לפי הדיווח, היא חותכת 95 אחוז מההזיות בדיבור וזכתה להעדפה של 63 אחוז במבחני השוואה מול קודמתה. המשמעות בשטח היא פחות הברות מומצאות ופחות רעשים מוזרים בקצוות של משפטים, תופעה שהייתה נפוצה מאוד בגרסאות פיתוח מוקדמות של מודלי אודיו בגודל הזה.

מתאים ל

  • עוזר קולי מקומי

    זמן השהיה נמוך מרבע שנייה על מעבד מאפשר שיחה רציפה באנגלית על חומרה ביתית ללא אינטרנט.

  • שרת שמע פנימי

    התאימות לממשק של OpenAI מאפשרת להחליף שירות ענן יקר בשרת עצמאי שצורך פחות מג'יגה זיכרון.

  • הקראת הודעות מערכת

    הזרמת סאונד באיכות 32kHz למשפטים קצרים שמתאימים בול למגבלות הזמן של המודל.

איפה זה נופל

החיסרון המרכזי והברור ביותר הוא השפה, המודל עובד באנגלית בלבד ואין לו שום תמיכה בעברית. בנוסף, הוא אומן על אלף שעות שמע בלבד, שזה היקף נמוך משמעותית ממודלים מקבילים. בגלל הדאטה המצומצם, הוא נוטה לשבש הגייה של מילים נדירות, מספרים וסימנים מיוחדים, ומחייב להמיר מספרים למילים כתובות לפני השליחה אליו. אין כאן שכפול קולות, המשפטים צריכים להיות קצרים יחסית, בין שתיים לחמש עשרה שניות, וטעויות דקדוק בטקסט הקלט גורמות לנפילה חדה באיכות הדיבור.

שאלות
נפוצות

האם המודל תומך בדיבור בעברית?

לא. המודל אומן על אנגלית בלבד ולא מזהה טקסט עברי. אם תזינו לו עברית תקבלו שגיאה או מלמולים לא מובנים.

האם חייבים מאיץ גרפי כדי להריץ אותו במהירות סבירה?

ממש לא. המודל מייצר שמע בקצב של פי עשרים מזמן אמת על מעבד רגיל, כך שהוא מסיים להקריא משפט בחבריר שנייה. כרטיס מסך נחוץ רק אם אתם רוצים זמן תגובה של מילישניות בודדות או משרתים הרבה בקשות במקביל.

איך מתמודדים עם מספרים ותווים מיוחדים בטקסט?

צריך להמיר אותם למילים באנגלית מראש, בקוד שלכם, לפני שהטקסט מגיע למודל. המודל מתקשה להגות ספרות וחישובים בצורה נכונה ונוטה לטעויות קריאה בלי המרה כזאת.

איך מריצים

המודל שוקל 271 מגה בייט וצורך פחות מג'יגה בייט אחד של זיכרון עבודה בזמן ריצה, כך שאפשר להרים אותו בקלות על לפטופ עם מעבד אינטל, מק עם מעבדי אפל, או שרת לינוקס פשוט. ההתקנה נעשית ישירות דרך פייתון, ויש תמיכה גם בהאצה דרך lmdeploy לצד המימוש הרגיל של transformers. עבור מי שרוצה לחבר אותו ישירות לתשתית קיימת, יש לו שרת פנימי שתואם לתקן ה־API של OpenAI להמרת דיבור.

אין סיבה לשלם לספקי ענן על API חיצוני אם אתם צריכים קריינות פשוטה באנגלית. במשאבים של שרת וירטואלי זול המודל הזה יעבוד מצוין. החריג היחיד הוא עומסים כבדים של משתמשים במקביל שדורשים פריסה מסובכת, או צורך באיכות קול של מודלי ענק מסחריים.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="ekwek/Soprano-1.1-80M")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא וחופשי. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו בתוך מוצר סגור, לשנות את הקוד ולהפיץ אותו, בלי לשלם תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗