GPT
M

MOSS-Audio-4B-Instruct

קוד פתוח

OpenMOSS-Teamapache-2.02026-04-10

  • safetensors
  • moss_audio
  • audio
  • speech
  • music

מודל שמע של 5.2 מיליארד פרמטרים שמתמלל, מנתח מוזיקה וסביבה ומתמודד עם חותמות זמן מדויקות. הוא מציע יכולות של מודלים ענקיים בגודל שמתאים לכרטיס מסך בודד.

  • 5.2Bפרמטרים
  • 9.7 GBמשקל הקבצים
  • 15,854הורדות בחודש
  • 82לייקים

מה זה

הארכיטקטורה משלבת מקודד שמע ייעודי שפועל ב־12.5 הרץ יחד עם מודל שפה מסוג Qwen3-4B. במקום להסתפק בהעברת המידע רק מהשכבה האחרונה, מנגנון הזרקה רב-שכבתי מעביר מאפיינים מוקדמים ישירות לשכבות הראשונות של מודל השפה. התוצאה היא שמירה טובה יותר על תכונות אקוסטיות נמוכות כמו גוון קול, קצב ורעשי רקע.

בנוסף לתמלול רגיל, שולבו טוקנים של זמן בתוך ייצוג השמע, מה שמאפשר לו להחזיר חותמות זמן ברמת המילה והמשפט. במבחני הדיוק הכלליים של הבנת שמע הוא מגיע לציון ממוצע של 64.04, ועוקף מודלים פתוחים של 7 מיליארד פרמטרים. במבחני הצמדת חותמות זמן באנגלית הוא מציג שגיאה של 358.13 AAS, לעומת 646.95 של Qwen3-Omni בגודל 30 מיליארד פרמטרים ו־871.19 של Gemini-3.1-Pro.

מתאים ל

  • סנכרון כתוביות לסרטונים

    המודל מדייק בהצמדת חותמות זמן למילים באנגלית ובסינית, מה שמתאים ליצירת קובצי כתוביות מדויקים בזמן קצר.

  • ניתוח רגש במוקדי שירות

    הוא מזהה רגש, טון דיבור, מגדר וגיל ברמת דיוק גבוהה, ועוזר לאפיין שיחות שירות מוקלטות מעבר לטקסט היבש.

  • תיוג סאונד ואפקטים

    זיהוי צלילי רקע וסביבה מאפשר לקטלג ספריות אודיו וקטעי מוזיקה לפי כלי נגינה, קצב ואווירה.

איפה זה נופל

המודל מוגבל רשמית לאנגלית ולסינית בלבד, כך שאין טעם לנסות להריץ עליו אודיו בעברית. לפי תוצאות התמלול, רמת הדיוק שלו צונחת משמעותית בדיאלקטים עם ציון שגיאה של 14.65, ובשירה עם שגיאה של 18.47. גם במצבי ריבוי דוברים שגיאת התמלול עומדת על 20.33, מה שהופך אותו לבעייתי עבור הקלטות של פגישות מרובות משתתפים.

אותה משפחה

MOSS-Audio יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחות בעברית?

לא. המודל אומן ותומך רק באנגלית ובסינית. הוא לא מיועד לעברית ויחזיר הזיות או תמלול שגוי.

מה ההבדל בין גרסת Instruct לגרסת Thinking?

גרסת Instruct מחזירה מענה ישיר ומהיר לפקודות כמו תמלול או תיאור שמע. גרסת ה־Thinking מפעילה שרשרת חשיבה פנימית שמסייעת בהסקה מורכבת יותר, אך מייצרת יותר טוקנים ומאטה את זמן התגובה.

האם המודל תומך בתמלול שמע מלוכלך ורועש?

הוא מתמודד לא רע עם רעשי רקע קלים ודיבור בלחש, אבל מתקשה כשכמה אנשים מדברים ביחד ומציג אחוזי שגיאה גבוהים יותר במצבים כאלה.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.7 גיגה-בייט, כך שאפשר להריץ אותו מקומית על כרטיס מסך יחיד עם 16 גיגה זיכרון וידאו, אם כי לסביבת ייצור עדיף כרטיס עם 24 גיגה כמו RTX 3090 או 4090 כדי לקבל מרווח נשימה לשמע ארוך. סביבת הריצה מבוססת על פייתון 3.12 עם חבילת ffmpeg 7 ותמיכה אופציונלית ב־FlashAttention 2 לשיפור ביצועים.

אם אתם צריכים לשרת בקשות בקצב גבוה, יש תמיכה ישירה בשרת SGLang עם trust-remote-code. למי שאין תשתית מקומית זמינה או שרוצה שרשרת חשיבה מעמיקה במקום תגובה ישירה, מודל ה־Thinking של הסדרה או מודלי ענן מסחריים יתאימו יותר.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-Audio-4B-Instruct

הרישיון

הרישיון הוא Apache 2.0, מה שמאפשר שימוש חופשי לחלוטין לפיתוח מסחרי ופרטי. מותר לשנות את הקוד והמשקלים, להטמיע אותם בתוך מוצרים סגורים ולהפיץ אותם, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗