GPT
S

Step-Audio-TTS-3B

קוד פתוח

stepfun-aiapache-2.02025-02-13

  • onnx
  • safetensors
  • step1
  • text-to-speech
  • custom_code

מודל דיבור בקוד פתוח שמייצר קול מטקסט בגישת שיחה, ומסוגל להפיק גם ראפ וזמזום. אם אתם צריכים שליטה בסגנונות דיבור ורגש בלי לשלם לפי דקת שמע, הוא מועמד מעניין לבדיקה.

  • 3.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 8.6 GBמשקל הקבצים
  • 288הורדות בחודש

מה זה

מדובר במודל שפועל כמודל שפה לכל דבר עם ארכיטקטורת Step1ForCausalLM ומאומן על בסיס נתונים סינתטי. הוא מקבל טקסט ומייצר ייצוגי אודיו בעזרת ספר קודים כפול, כאשר המאגר כולל גם ווקודר ייעודי לזמזום וקול רגיל. השילוב הזה מאפשר לו לעבור מדיבור יומיומי לביצועים קוליים מורכבים יותר כמו שירה קצבית.

במבחני דיוק תוכן באנגלית ובסינית, הוא מציג שיעור שגיאות מילים של 2.31 אחוזים באנגלית ושיעור שגיאות תווים של 1.31 אחוזים בסינית על בנצ'מרק SEED. המספרים האלה מראים שהוא מפספס פחות מילים בהשוואה למודלים פתוחים מקבילים, אבל מדדי הדמיון לקול המקורי מעט נמוכים יותר ממתחרים כמו CosyVoice 2.

מתאים ל

  • הפקת קטעי ראפ וזמזום

    הוא כולל ווקודר ייעודי שמאפשר לייצר שירה וזמזום ישירות מטקסט, יכולת שלא קיימת ברוב מודלי הדיבור.

  • קריינות באנגלית ובסינית

    שיעור שגיאות המילים שלו נמוך במיוחד במבחנים הרשמיים, מה שמבטיח הקראה מדויקת של טקסטים ללא פספוסים.

  • שילוב בבוטים קוליים

    ארכיטקטורת הצ'אט והשליטה ברגשות מתאימות למענה קולי מגוון ביישומי שיחה מבוססי שרת מקומי.

איפה זה נופל

הכרטיס מציג תוצאות רק עבור אנגלית וסינית, ואין בו שום מידע על תמיכה בעברית או באיכות הפלט בשפות שאינן נבדקו במפורש. אם אתם בונים שירות שמיועד לקהל ישראלי, סביר להניח שתיתקלו בהגיות שגויות או בחוסר יכולת לקרוא את הטקסט בכלל.

בנוסף, מדד הדמיון הקולי שלו במבחנים עומד על 0.660 באנגלית לעומת יותר מ־0.74 אצל מתחרים בקטגוריה. המשמעות היא שההעתקה של סגנון קול ספציפי פחות מדויקת, אפילו שהטקסט עצמו מוקרא בצורה נכונה.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

החומר הרשמי מציג בדיקות רק על אנגלית וסינית ולא מזכיר עברית כלל. לא כדאי להסתמך עליו לפרויקט בעברית בלי לבדוק קודם אם המודל מזהה את האותיות או נכשל לחלוטין.

מה ההבדל בין גרסת הרגילה לגרסת Single?

לפי נתוני הבדיקות, גרסת Single משתמשת בווקודר בעל ספר קודים יחיד ומציגה דיוק תוכן מעט נמוך יותר אך ציון דמיון קולי גבוה יותר. הגרסה המלאה Step-Audio-TTS-3B משיגה פחות שגיאות בהקראת הטקסט עצמו.

איך מריצים

כדי להריץ אותו מקומית תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי, בהתחשב במשקל של 8.6 גיגה בפורמט bfloat16 ובצורך להריץ במקביל את הווקודר לסינתזה. חלון ההקשר עומד על 32,768 טוקנים, כך שניתן להזין טקסטים ארוכים במיוחד, אך צריכת הזיכרון תעלה בהתאם.

אם יש לכם כרטיס חלש יותר או שאתם מחפשים פתרון קל להרצה בטלפון ובשרתים זולים, הקמה עצמית של המודל הזה תהיה כבדה מדי. במקרה של עומס רגעי או חוסר בחומרה ייעודית, שירות מנוהל חיצוני יהיה פשוט וזול יותר לתחזוקה שוטפת.

pip install -U huggingface_hub
hf download stepfun-ai/Step-Audio-TTS-3B

הרישיון

המודל משוחרר ברישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי הקוד והפצה חופשית. אתם יכולים לשלב אותו במוצר מסחרי סגור, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗