GPT
S

svara-tts-v1

קוד פתוח

kenpathapache-2.02025-10-26

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-to-speech

המרת טקסט לדיבור ב־19 שפות מאזור הודו, כולל אנגלית מקומית. הוא בנוי על ארכיטקטורת שפה סטנדרטית ומאפשר שליטה ברגש ובזהות הדובר בעזרת תגיות טקסט פשוטות.

  • 3.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 12.3 GBמשקל הקבצים
  • 150,669הורדות בחודש

מה זה

במקום להשתמש במבנה נפרד של מודלי שמע ישנים, הוא מממש TTS מעל ארכיטקטורת Llama רגילה דרך טוקנים בדידים של אודיו. הוא נבנה על בסיס שיטת Orpheus ואומן על יותר מ־2000 שעות הקלטה של כ־50 דוברים שונים, במטרה לתת מענה ממוקד לשפות של תת־היבשת ההודית כמו הינדי, בנגלי, טמילית ואנגלית הודית.

השליטה בהפקה מתבצעת כחלק מהטקסט עצמו. אפשר להגדיר דובר לפי שפה ומגדר, או לשתול בסוף המשפט תגיות כמו happy, sad או clear כדי לשנות את הטון ורמת הבהירות. הוא מתמודד גם עם ערבוב שפות נפוץ באותו משפט, מה שמאפשר לו להישמע טבעי יותר בשיחות יומיומיות בהשוואה למודלים שמקובעים לשפה בודדת.

מתאים ל

  • מענה קולי רב־לשוני בהודו

    מתאים למוקדי שירות הודות לתמיכה ב־19 שפות מקומיות, ערבוב שפות נפוץ ושליטה בסיסית במגדר הדובר.

  • הקראת תוכן לימודי

    שימוש בתגית clear מאפשר הפקת שמע ברור ומדויק יותר של טקסטים עיוניים וספרי לימוד.

  • התאמת קולות עם LoRA

    הארכיטקטורה מקלה על אימון שכבות נוספות כדי להוסיף דוברים חדשים או סגנונות דיבור לתחום ספציפי.

איפה זה נופל

שמות פרטיים ומונחים טכניים נדירים נוטים להישבש אלא אם מוסיפים הנחיות איות או את התגית clear. במשפטים ארוכים מאוד הקצב והאינטונציה מאבדים יציבות, כך שחייבים לפצל את הטקסט למקטעים קצרים ולדייק בסימני הפיסוק. בנוסף, עוצמת הרגשות לא אחידה בין כל 19 השפות בגלל הבדלים בכמויות המידע שעליו הוא אומן, וערבוב שפות חריג עלול להניב שגיאות הגייה לא צפויות.

שאלות
נפוצות

האם המודל תומך בהפקת דיבור בעברית?

לא. המודל אומן באופן בלעדי על 18 שפות הודיות ועל אנגלית הודית. טקסט בעברית לא יופק בצורה תקינה.

איך משפיעים על הרגש והאינטונציה של ההקראה?

מוסיפים תגיות מוגדרות מראש כמו happy או anger ממש בסוף המשפט, ונעזרים בסימני פיסוק כמו פסיקים ושלוש נקודות כדי לייצר הפסקות טבעיות.

איך מריצים

בגודל של 3.3 מיליארד פרמטרים ומשקל קבצים של 12.3 גיגה־בייט ב־bfloat16, תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה־בייט זיכרון כדי להריץ אותו בנוחות עם ספריות transformers. המפתחים מציינים שהוא עובד טוב גם בייצוא לפורמט GGUF, מה שמוריד את דרישות החומרה ומאפשר להריץ אותו ישירות על מעבדים או מכשירי קצה.

אם אין לכם כרטיס מתאים מקומית, עדיף להרים קולאב או מכונה שכורה לפי שעה, כי סקריפטי ההסקה הרשמיים מתאימים לסביבות כאלה. אין לו כרגע שירות ענן סגור שמחייב לפי קריאה, כך שהרצה עצמית היא הדרך העיקרית לעבוד איתו.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="kenpath/svara-tts-v1")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לאמן LoRA ולהפיץ אותו בתוך מוצר בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗