GPT
S

Step-Audio-R1.1

קוד פתוח

stepfun-aiapache-2.02026-01-14

  • transformers
  • safetensors
  • step_audio_2
  • text-generation
  • audio-reasoning

מודל שיחה קולי שמבצע חשיבה והסקה תוך כדי דיבור. הוא מיועד למי שצריך תגובה מהירה בלי לוותר על מורכבות התוכן.

  • 33Bפרמטרים
  • 65,536טוקנים בהקשר
  • 62.4 GBמשקל הקבצים
  • 387הורדות בחודש

מה זה

המודל הזה מטפל בקלט שמע וטקסט ומחזיר טקסט, כשהוא בנוי סביב ארכיטקטורה של שני חלקים נפרדים. חלק אחד אחראי על תהליך החשיבה וההסקה, והחלק השני ממוקד בהפקת הפלט. המבנה הזה נועד לאפשר לו לבצע שרשרת חשיבה בזמן אמת בלי לעצור את הדיבור ובלי לייצר שיהוקים בזמני התגובה.

במקום להמיר את השמע לטקסט ורק אז לנתח אותו, הוא מעבד את הנתונים האקוסטיים ישירות. לפי מפתחי המודל, הגישה הזו מונעת פגיעה באיכות ההסקה ומביאה אותו לתוצאות מובילות במבחן הביצועים AA. עם 33 מיליארד פרמטרים וחלון הקשר של 65,536 טוקנים, מדובר במערכת כבדה שמיועדת למשימות קוליות מורכבות.

מתאים ל

  • עוזרים קוליים אינטראקטיביים

    הוא מבצע חשיבה בזמן אמת ומספק תגובה מהירה בלי לעצור את הדיאלוג.

  • ניתוח ישיר של שיחות שמע

    הוא מעבד ישירות מאפיינים אקוסטיים ולא מסתמך רק על תמלול מקדים.

  • מערכות דיאלוג מורכבות

    חלון הקשר של 65 אלף טוקנים מאפשר ניהול שיחות טכניות ארוכות מאוד.

איפה זה נופל

הדרישות הטכניות כאן מורכבות. אי אפשר להשתמש בגרסת vLLM רגילה וצריך להסתמך על פורק ייעודי של החברה, מה שמסבך עדכונים ותחזוקה שוטפת. בנוסף, חומרת היעד שנבדקה דורשת לפחות ארבעה מעבדים גרפיים חזקים, כך שעלויות ההרצה העצמית גבוהות במיוחד. אין בתיעוד מידע לגבי תמיכה בשפות שאינן אנגלית או סינית, ולכן חובה לבדוק יכולות בעברית לפני שבונים עליו לקהל מקומי.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

לא. המודל שוקל מעל 60 גיגה בייט ודורש תשתית שנבדקה על מערכים של ארבעה מאיצים חזקים כמו L40S או H100. תצטרכו שרת ייעודי או שימוש ב־API.

האם אפשר להשתמש בהתקנת vLLM סטנדרטית?

לא, המודל דורש גרסה מותאמת אישית של vLLM עם ענף קוד ספציפי של stepfun. תצטרכו להשתמש בדוקר שהם מספקים או לקמפל את הפורק שלהם ישירות מהמקור.

האם המודל מפיק שמע בחזרה?

לפי הגדרת המשימה הרשמית שלו הוא מוגדר כ־audio-text-to-text, כלומר מקבל קול וטקסט ומחזיר טקסט. התיעוד מזכיר רכיב הפקת דיבור, אך אופן הפלט בפועל תלוי במימוש דרך השרת המותאם.

איך מריצים

כדי להריץ אותו מקומית תצטרכו שרת לינוקס עם חומרה רצינית מאוד. המפתחים בדקו אותו על מערכים של ארבעה כרטיסי NVIDIA מדגמי L40S, H100, H800 או H20, כך שמחשב פיתוח רגיל לא יספיק כאן. הקבצים עצמם שוקלים 62.4 גיגה בייט.

מבחינת תוכנה, נדרש פייתון 3.10 ומעלה וגרסה מותאמת אישית של vLLM שהם פיתחו. אפשר להרים את זה דרך תמונת דוקר מוכנה שהם מספקים או לקמפל את הקוד מהמאגר שלהם. אם אין לכם את כוח העיבוד הזה בענן או בחוות השרתים, עדיף להשתמש בסטודיו שלהם או לגשת דרך ה־API של הפלטפורמה.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="stepfun-ai/Step-Audio-R1.1")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי, כולל שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל בתוך מוצרים. התנאים המרכזיים הם שמירה על הודעות זכויות היוצרים המקוריות וצירוף עותק של הרישיון בכל הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗