GPT
D

dots.tts-soar

קוד פתוח

dots-studioapache-2.02026-06-04

  • dots_tts
  • safetensors
  • text-to-speech
  • tts
  • audio

מודל דיבור רציף של 2.2 מיליארד פרמטרים שמתמקד בשכפול קול מדויק. הוא מדלג על טוקנים קוליים בדידים לטובת אודיו באיכות 48 קילו-הרץ ישירות מהטקסט.

  • 2.2Bפרמטרים
  • 4.8 GBמשקל הקבצים
  • 3,337הורדות בחודש
  • 91לייקים

מה זה

הארכיטקטורה מחברת מודל שפה של 1.5 מיליארד פרמטרים מבית Qwen2.5 עם ראש flow-matching ומפענח VAE של 48 קילו-הרץ. בניגוד לרוב מודלי הדיבור שממירים אודיו לקודים בדידים ואז מקודדים אותם מחדש, כאן התהליך רציף לחלוטין מתחילתו ועד סופו.

גרסת soar עברה שלב אימון נוסף שנקרא Self-corrective Alignment ללא מערכת תגמול חיצונית. במבחני Seed-TTS-Eval היא מציגה דמיון דובר ממוצע של 79.2 ושיעור שגיאות מילים של 2.95, ובמבחן רב-לשוני של 24 שפות היא מובילה בדמיון הדובר עם ציון 83.9, אם כי שיעור השגיאות שם עומד על 6.8 ומעיד על פחות יציבות בתמלול כשמתרחקים מאנגלית ומסינית.

מתאים ל

  • שכפול קול בהפקה

    אידאלי כשחייבים דיוק מרבי לגוון הקול המקורי באיכות 48 קילו-הרץ, ומספיקה דגימת אודיו קצרה עם תמלול.

  • דיבוב חוצה שפות

    מוביל במבחני דמיון קול בהעברה בין אנגלית לסינית, תוך שמירה על זהות הדובר המקורי.

  • בסיס לכוונון עדין

    נקודת מוצא טובה לאימון על קולות ספציפיים בזכות ההצמדה המדויקת בין הטקסט לגוון הדיבור.

איפה זה נופל

בגלל הסתמכות על טוקנייזר BPE רגיל של מודל השפה ללא פונמות, שפות עם מעט משאבים כמו ערבית, הינדי, טורקית או וייטנאמית סובלות משיעור שגיאות גבוה באופן מורגש, למרות שגוון הקול נשמר. עברית אפילו לא מוזכרת בבנצ'מרקים וסביר שתתנהג באופן דומה או גרוע מכך.

המודל אומן על דיבור בלבד. הוא לא יודע לשיר, לא מייצר אפקטים קוליים ולא מתאים ליצירת פסקול שמערבב מוזיקה ורעשי רקע.

שאלות
נפוצות

האם המודל תומך בעברית בצורה שוטפת?

החומרים הרשמיים מתמקדים בעיקר באנגלית ובסינית, לצד בדיקות ב־24 שפות אחרות. מאחר שהמודל מסתמך על BPE של Qwen2.5 ללא פונמות, שפות ללא ייצוג חזק באימון סובלות משגיאות הגייה רבות. יש לבדוק ידנית את איכות הפלט בעברית לפני כל שימוש.

למה לבחור בגרסת soar ולא בגרסת mf או base?

גרסת base מיועדת בעיקר למי שרוצה לאמן הכל מאפס עם שליטה מלאה בפרמטרים, בעוד גרסת mf מותאמת למהירות גבוהה עם מעט צעדי דגימה. גרסת soar מכוונת לאיכות הצליל הגבוהה ביותר ולדמיון המרבי לקול המקורי, ולכן היא ברירת המחדל להפקת דיבור שאינה דורשת זמן תגובה מיידי.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני עם לפחות 12 עד 16 גיגה-בייט זיכרון גרפי, בהתאם לדיוק bfloat16 שמומלץ בקוד. הקבצים עצמם שוקלים 4.8 גיגה-בייט, והקריאה דורשת התקנת חבילת dots_tts ממאגר הגיטהאב יחד עם קובץ תלויות מוגדר.

בזמן ההסקה אפשר לשלוט על מספר הצעדים בין 10 ל־32, כשברירת המחדל להנחיה היא 1.2. אם אתם צריכים זמני תגובה מהירים מאוד ליישומי שיחה, עדיף להסתכל על גרסת dots.tts-mf שמזוקקת לארבעה צעדים, או לפנות לשירות ענן אם אין לכם חומרת GPU ייעודית זמינה.

pip install -U huggingface_hub
hf download dots-studio/dots.tts-soar

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗