GPT
S

Step-Audio-Chat

קוד פתוח

stepfun-aiapache-2.02025-02-13

  • safetensors
  • step1
  • audio-text-to-text
  • custom_code

מודל שפה רב-מודאלי שמטפל ישירות בדיבור, זיהוי קולי, שיבוט קול ויצירת אודיו. הוא מיועד למי שרוצה שיחה קולית מלאה במערכת אחת במקום שרשור כלים נפרדים.

  • 132Bפרמטרים
  • 32,768טוקנים בהקשר
  • 246 GBמשקל הקבצים
  • 115הורדות בחודש

מה זה

מדובר ברכיב מרכזי בתוך פרויקט שמשלב הבנת שמע והפקת דיבור תחת קורת גג אחת. הוא מחזיק ארכיטקטורה של 88 שכבות וחלון הקשר של 32,768 טוקנים, מה שמאפשר לו לעבד שיחות ארוכות בלי לאבד את חוט המחשבה.

במבחני ביצועים מול מודלים קוליים אחרים כמו GLM4-Voice או Qwen2-Audio, הוא מציג דיוק עובדתי ורלוונטיות גבוהים יותר במדד StepEval-Audio-360 שנבדק באמצעות GPT-4o. במבחנים פומביים כמו Llama Question ו־Web Questions הוא מוביל על המתחרים בפער ניכר, וקיבל ציון של 86.0 במבחן HSK-6, מה שמלמד על יכולות חזקות במיוחד בסינית.

הייחוד כאן הוא השילוב הישיר של שיבוט קול ושליטה במאפייני הדיבור בתוך מודל השפה עצמו, במקום להשתמש במודל טקסט שמחובר למנוע הקראה חיצוני.

מתאים ל

  • עוזר קולי לשיחות שוטפות

    מתאים לניהול דיאלוג קולי שלם עם רלוונטיות גבוהה לפי מבחני StepEval-Audio-360.

  • שיבוט קול ופרסונליזציה

    מיועד להפקת דיבור ושליטה במאפייני הקול ישירות מתוך מודל השפה.

  • מענה לשאלות ידע מורכבות

    קיבל ציון 74.0 ב־ComplexBench, מעל מודלים קוליים מתחרים שנבדקו מולו.

איפה זה נופל

בבדיקות של ביצוע הוראות קוליות בתחום השירה והראפ הוא קיבל ציון נמוך של 2.4 מתוך סולם המדידה, כך שאל תבנו עליו ליצירת מוזיקה מורכבת. מעבר לזה, ההצטיינות במבחן HSK-6 מעידה על אוריינטציה כבדה לסינית, ואין בכרטיס המודל שום נתון על ביצועים בעברית או בתמיכה רב לשונית רחבה. חובה לבדוק התנהגות בשפה המקומית לפני שמבססים עליו מוצר.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך בודד?

לא. המשקלים תופסים 246 גיגה-בייט, כך ששום כרטיס גרפי יחיד כיום אינו מחזיק מספיק זיכרון כדי לטעון אותו. נדרש שרת עם מספר כרטיסים ייעודיים.

האם המודל יודע לדבר עברית?

התיעוד לא מפרט תמיכה בעברית ומציג בעיקר מבחנים באנגלית ובסינית. מומלץ לבדוק את איכות ההבנה וההפקה בעברית באופן עצמאי לפני תחילת פיתוח.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו שרת כבד מאוד. המשקלים בלבד תופסים 246 גיגה-בייט בפורמט bfloat16 על פני 38 קבצים, כך שצריך מערך של כמה מעבדים גרפיים עם זיכרון וידאו משמעותי רק כדי לטעון אותו לזיכרון לפני שבכלל התחלתם להזרים טוקן אחד.

אם אין לכם אשכול מחשוב ייעודי עם תקשורת מהירה בין המאיצים, עדיף להמתין לממשקי ענן או שירותים מנוהלים. להרים מפלצת כזו בתשתית מקומית זה כאב ראש תפעולי ששווה את המאמץ רק אם הפרטיות או השליטה המלאה בקוד ובקול קריטיות עבורכם.

pip install -U huggingface_hub
hf download stepfun-ai/Step-Audio-Chat

הרישיון

הרישיון הוא apache-2.0. זה רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש, בכפוף לשמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית. אתם יכולים לשלב אותו במוצר מסחרי בלי לשלם תמלוגים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗