GPT
S

Step-Audio-2-mini

קוד פתוח

stepfun-aiapache-2.02025-08-28

  • transformers
  • onnx
  • safetensors
  • step_audio_2
  • text-generation

מודל שיחה מקצה לקצה באודיו שמסוגל להבין שפה, לחלץ רגשות ומאפייני קול, ולהפעיל כלים חיצוניים ישירות מקלט קולי.

  • 8.3Bפרמטרים
  • 16,384טוקנים בהקשר
  • 16.7 GBמשקל הקבצים
  • 8,237הורדות בחודש

מה זה

המודל הזה מטפל באודיו בצורה ישירה בלי לפרק את התהליך לצינור נפרד של תמלול, מודל שפה והקראה. הוא מבין סמנטיקה לצד מאפיינים פארא-לשוניים כמו טון, גיל ומהירות דיבור, ואפילו תומך בהפעלת כלים וחיפוש מידע משולב אודיו כדי לצמצם הזיות.

בבדיקות תמלול באנגלית הוא מציג שיעור שגיאות ממוצע של 3.50% מול 4.50% של GPT-4o Transcribe, ובמבחני זיהוי מאפייני שמע הוא עומד על ציון 80 לעומת 43.45 של GPT-4o Audio. בפועל, החוזק שלו הוא היכולת לזהות ניואנסים קוליים ולהגיב אליהם, ולא רק לקרוא את הטקסט היבש מתוך ההקלטה.

מתאים ל

  • עוזר קולי למוקדי שירות

    זיהוי כעס או מצוקה של הלקוח דרך אינטונציה ומהירות דיבור, ומענה מותאם באנגלית.

  • תרגום קולי מאנגלית לסינית

    המרת דיבור ישירה בין שתי השפות עם דיוק גבוה שנשען על שמירת טון המקור.

  • מערכת תמלול לפודקאסטים

    תמלול מדויק באנגלית שמבדיל בין סוגי קולות ואירועי רקע לצורך עריכה מהירה.

איפה זה נופל

התמיכה מוגבלת לאנגלית וסינית, ואין לו שום תמיכה בעברית. במבחני זיהוי מבטאים מקומיים בסין הוא הגיע לחלק מהשגיאות עד 19.30%, ובמבחני תרגום מדיבור לדיבור הוא מעט חלש יותר מהגרסה המלאה של המודל. בנוסף, לא פורסמו נתוני ביצועים סופיים לטבלת הפעלת הכלים עבור גרסת המיני, מה שמחייב בדיקה ידנית לפני שסומכים עליו בתרחישי ייצור.

שאלות
נפוצות

האם המודל מבין או מדבר בעברית?

לא, המודל אומן ותומך רשמית רק באנגלית ובסינית. אין בו תמיכה בעברית, ולכן הוא לא יתאים למוצרים הפונים לקהל מקומי בישראל.

האם חייבים לחבר מודל תמלול נפרד כדי לעבוד איתו?

אין צורך, המודל עובד ישירות מקצה לקצה. אתם מזרימים קובץ שמע, והוא מפעיל את ההבנה, ההיגיון והתשובה ישירות מתוך האודיו.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־16.7 גיגה-בייט, כך שצריך כרטיס מסך מודרני עם לפחות 24 גיגה-בייט זיכרון כדי לטעון ולהריץ אותו בצורה מקומית ויציבה. ההתקנה נשענת על PyTorch בגרסה 2.3 ומעלה, סביבת CUDA מתאימה, ותלויות ייעודיות לעיבוד שמע כמו librosa, torchaudio ו־s3tokenizer.

אם אתם רוצים רק לבדוק תמלול בסיסי או שאין לכם חומרה כבדה וזמינה כל הזמן, עדיף לפנות ל־API חיצוני דרך הפלטפורמה של החברה. שווה להרים שרת עצמאי רק כשצריכים שליטה מלאה בנתונים, לטנטי נמוך מקצה לקצה, או יכולות חיבור ישירות לכלים פרטיים.

from transformers import pipeline

pipe = pipeline("any-to-any", model="stepfun-ai/Step-Audio-2-mini")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗