GPT
S

s2-pro

קוד פתוח

fishaudioother2026-03-09

  • safetensors
  • fish_qwen3_omni
  • text-to-speech
  • instruction-following
  • multilingual

מודל דיבור בקוד פתוח שמתמקד בשליטה רגשית מדויקת, עם תמיכה בהנחיות טקסט חופשיות ישירות בתוך המשפט כדי לכוון אינטונציה, לחישות או צחוק ברמת המילה הבודדת.

  • 4.6Bפרמטרים
  • 10.3 GBמשקל הקבצים
  • 187,749הורדות בחודש
  • 1,347לייקים

מה זה

בבסיס יושבת ארכיטקטורה כפולה של כמעט 4.6 מיליארד פרמטרים. מודל אטי של 4 מיליארד פרמטרים מנהל את הרצף על ציר הזמן ואת המשמעות, ומודל מהיר של 400 מיליון פרמטרים משלים את הפרטים האקוסטיים דרך עשרה ספרי קוד של אודיו. הוא נבנה על מנוע SGLang, מה שאומר שהוא מקבל מראש יכולות של מודלי שפה רגילים כמו זיכרון מטמון יעיל ועיבוד רציף במנות.

השליטה בהקראה נעשית בלי להסתבך עם קבצי הגדרות מורכבים. אתם שותלים תגיות טקסט ישירות בתוך התוכן, משהו כמו הוראה ללחוש או להישמע מופתע, והוא מעבד אותן מתוך מאגר של יותר מ־15,000 תגיות מוכרות יחד עם תיאורים חופשיים. זה מאפשר לייצר שיחות שנשמעות מגוונות ומגיבות לשינויי מצב רוח בלי לחתוך את המשפטים מראש.

מתאים ל

  • דיבוב סצנות עם רגש משתנה

    תגיות הטקסט החופשיות מתאימות להנחיית לחישות, צעקות או אנחות בתוך רפליקות משחק בלי עריכת סאונד ידנית.

  • בוטים קוליים באנגלית ובסינית

    זמן התגובה הקצר והתמיכה המלאה בשפות דרג ראשון נותנים מענה שוטף לשיחות הזרמה בזמן אמת.

  • הקראת סיפורים ופודקאסטים

    הארכיטקטורה יודעת לשמור על רצף שמע יציב לאורך קטעים ארוכים עם מעברים טבעיים בין דמויות ומקצבים.

איפה זה נופל

למרות שהכרטיס מציין תמיכה בעברית ברשימת השפות המשנית, היא לא נמצאת בדרגות הראשונות. המודל מתמקד ומאומן היטב על אנגלית, יפנית וסינית, וברמה מעט נמוכה יותר על שפות כמו ערבית, רוסית או ספרדית. זה אומר שלפני שמתכננים עליו למערכת בעברית, חובה לבדוק איכות דיקציה, מבטא ורמת קריאות, כי הוא עלול להישמע מאולץ ולא מדויק. בנוסף, חומרי התיעוד לא מפרטים ביצועים על חומרות חלשות יותר, כך שלא בטוח איך הוא יגיב תחת עומס שאינו מאיץ שרתים מתקדם.

שאלות
נפוצות

האם המודל מתאים לייצור מיידי של דיבור בעברית?

השפה העברית מופיעה רק ברשימת השפות הנוספות ולא בשכבות הראשיות שקיבלו את עיקר האימון. סביר להניח שרמת ההגייה והטונציה שלה פחות מוצלחות מאשר באנגלית או יפנית. מומלץ להריץ בדיקות איכות מקיפות על טקסטים מקומיים לפני שמתחייבים לפיתוח.

אפשר להריץ אותו על כרטיס מסך ביתי פשוט?

המודל שוקל מעל 10 גיגה בייט ומחזיק 4.6 מיליארד פרמטרים בארכיטקטורה מפוצלת. הבדיקות שפורסמו בוצעו על מעבד גרפי עוצמתי מדגם H200 כדי להגיע לשיהוי נמוך. כרטיס ביתי ממוצע עשוי להיתקל בבעיות זיכרון ולא יספק חוויית הזרמה בזמן אמת.

איך מריצים

המשקל הכולל של הקבצים עומד על 10.3 גיגה בייט ב־13 קבצים. כדי להריץ אותו בהזרמה חיה עם שיהוי של כ־100 מילישניות תצטרכו כרטיס גרפי ברמה גבוהה מאוד, כאשר הבדיקות הרשמיות מציגות פקטור זמן אמת של 0.195 על גבי NVIDIA H200 בודד.

אם אין לכם חומרה ייעודית כזו בענן או במשרד, התקנה מקומית תקרטע. במקרה כזה כדאי לפנות לממשק ה־Playground או להשתמש בחיבור ענן מרוחק במקום להחזיק שרת יקר שיעמוד ללא שימוש רוב הזמן.

pip install -U huggingface_hub
hf download fishaudio/s2-pro

הרישיון

הרישיון מוגדר תחת Fish Audio Research License. הוא חופשי לחלוטין לצורכי מחקר, לימודים ושימוש שאינו מסחרי. מי שמתכנן לשלב אותו במוצר עסקי שמוכר שירות או מייצר הכנסה חייב לפנות ישירות ליוצרים ולרכוש רישיון מסחרי נפרד, אחרת זו הפרה ישירה של תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗