GPT
S

Soprano-80M

קוד פתוח

ekwekapache-2.02025-12-17

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • text-to-speech

המרת טקסט לדיבור בקובץ של 210 מגהבייט שרץ ישירות על החומרה המקומית. הוא מפיק אודיו מהר מאוד ובצריכת זיכרון נמוכה, אבל סובל מהזיות בהשוואה לגרסתו החדשה.

  • 80Mפרמטרים
  • 512טוקנים בהקשר
  • 210 MBמשקל הקבצים
  • 227הורדות בחודש

מה זה

מדובר במודל טקסט לדיבור זעיר שמבוסס על ארכיטקטורת Qwen3 ומחזיק כמעט שמונים מיליון פרמטרים. הוא מייצר אודיו בקצב דגימה של 32kHz, ומציג מהירות עבודה גבוהה שמגיעה עד פי עשרים מזמן אמת על מעבד רגיל, ופי אלפיים על כרטיס גרפי. השהיית תחילת הנגינה נמוכה, פחות מחמש עשרה מילישניות על מעבד גרפי ומתחת למאתיים וחמישים מילישניות על מעבד מרכזי.

היתרון המרכזי פה הוא דרישות המערכת המינימליות. הוא תופס פחות מג'יגהבייט אחד של זיכרון עבודה, ומפצל משפטים באופן אוטומטי כדי לעקוף את מגבלת חלון ההקשר הקצר שעומד על 512 טוקנים בלבד. יוצר המודל הוציא לו בהמשך גרסה משופרת בשם 1.1, ולפי הנתונים שלו, המשתמשים העדיפו אותה בשישים ושלושה אחוזים מהמקרים בזכות צמצום של תשעים וחמישה אחוזים בהזיות הדיבור.

מתאים ל

  • הקראת ממשק מקומית

    צריכת הזיכרון נמוכה מגיגהבייט אחד ומאפשרת להשמיע חיווי קולי מהיר ישירות ממחשב הקצה בלי תלות ברשת.

  • שרת הקראה תואם OpenAI

    הקמת שירות מקומי שמתחבר ליישומים קיימים דרך פרוטוקול מוכר ואינו דורש חומרה יקרה.

  • המרת טקסט רציף על מעבד

    ייצור אודיו פי עשרים מזמן אמת על גבי מעבד מרכזי בלבד מתאים לעיבוד קבצי טקסט באנגלית ללא כרטיס גרפי.

איפה זה נופל

היוצר מציין בעמוד שהגרסה הזו מיושנת ומוחלפת בידי גרסה 1.1. המודל אומן על אלף שעות שמע בלבד, נפח נמוך בהרבה ממודלים מקבילים, ולכן הוא מתקשה בהגיית מילים לא שגרתיות. הוא מוגבל לשפה האנגלית בלבד ולא מציע יכולות שכפול קול. בנוסף, הוא מתקשה להגות נכון מספרים וסימנים מיוחדים, ומחייב תמלול פונטי מראש של תווים כאלה כדי לקבל תוצאה סבירה.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל אומן ומיועד לשפה האנגלית בלבד, ואינו תומך בשפות נוספות.

האם כדאי להשתמש בגרסה הזו בפרויקט חדש?

לא מומלץ. יוצר המודל מצהיר במפורש שהגרסה הזו מיושנת ומפנה לגרסה 1.1 שמקטינה משמעותית את כמות השיבושים בדיבור.

איך מריצים

המודל פועל ישירות מול ספריית transformers או דרך תשתית lmdeploy, ודורש התקנה של חבילת soprano ייעודית. המפתחים שלו מספקים ממשק שורת פקודה, שרת תואם לפרוטוקול של OpenAI, וגם ממשק רשת מקומי. מכיוון שהוא דורש פחות מגיגהבייט אחד של זיכרון, אפשר להריץ אותו בלי בעיה על מחשב נייד פשוט, מעבדי אפל דרך מאיץ MPS, או שרת לינוקס בסיסי ללא כרטיס מסך ייעודי.

בסביבת חלונות עם כרטיס גרפי של אנבידיה צריך לשים לב להתקנה ידנית של גרסת PyTorch מתאימה ל־CUDA, כי התקנת ברירת המחדל שם מתבססת על מעבד בלבד. אם יש לכם צורך בייצור קולות רבים במקביל, כדאי להגדיל את גודל ה־batch של המפענח ואת הקצאת הזיכרון למטמון, או לפנות למודל חיצוני אם אתם לא רוצים לתחזק שרת מקומי.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="ekwek/Soprano-80M")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש חופשי בקוד ובמשקולות המודל למטרות פרטיות ומסחריות, כולל שינוי, הפצה מחדש והטמעה במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗