GPT
M

MOSS-Audio-8B-Thinking

קוד פתוח

OpenMOSS-Teamapache-2.02026-04-13

  • safetensors
  • moss_audio
  • audio
  • speech
  • music

מודל אודיו שמנתח דיבור, מוזיקה ורעשי רקע ומבצע עליהם שרשרת חשיבה מעמיקה. הוא מיועד למי שצריך תמלול מדויק בזמן, איתור אירועים קוליים והסבר מנומק של המתרחש בהקלטה.

  • 9.1Bפרמטרים
  • 16.9 GBמשקל הקבצים
  • 1,675הורדות בחודש
  • 83לייקים

מה זה

הארכיטקטורה מחברת מקודד ייעודי שרץ בקצב 12.5 הרץ למודל שפה מסוג Qwen3 בנפח 8B, עם הזרקת שכבות ביניים לשמירה על צבע קול ופרטים אקוסטיים עדינים. בשונה ממודלים שרק מתמללים את המילים או מחזירים תשובה מיידית, גרסת ה־Thinking מייצרת תהליך חשיבה מובנה שלב אחר שלב לפני מתן הפלט הסופי. הדבר מאפשר לו להסיק מסקנות מורכבות על הקשרים בין רעשי סביבה, טון הדוברים ותוכן השיחה.

במדדי הבנת אודיו כלליים הוא מגיע לציון דיוק ממוצע של 70.80, נתון שעוקף מודלים פתוחים אחרים בקטגוריה שלו ואף מתחרה במערכות גדולות בהרבה. בנוסף, מנגנון הטמעת סמני הזמן שלו מוביל לביצועים חריגים בהצמדת חותמות זמן למילים ולמשפטים, עם שגיאות נמוכות משמעותית בהשוואה למודלים ענקיים כמו Qwen3-Omni או Gemini-3.1-Pro במבחני LibriSpeech ו־AISHELL.

מתאים ל

  • תחקור הקלטות מורכבות

    מנתח שיחות ומחלץ קשרים בין טון הדיבור לרעשי רקע באמצעות שרשרת חשיבה.

  • כתוביות מסונכרנות בדיוק גבוה

    מייצר תמלול באנגלית עם חותמות זמן מדויקות ברמת המילה הודות למקודד הזמן.

  • קטלוג אירועים אקוסטיים

    מזהה רעשי סביבה, מעברים מוזיקליים וסגנונות נגינה בקבצי קול מגוונים.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שעיבוד שפות אחרות ובהן עברית אינו נתמך וידרוש אימון נוסף. שרשרת החשיבה מוסיפה השהיה ניכרת לכל תשובה, מה שהופך אותו ללא מתאים לשיחות קוליות בזמן אמת. בנוסף, למרות ביצועים גבוהים בדיבור, במבחני תמלול מרובי משתתפים כמו AISHELL-4 הוא עדיין רושם שיעורי שגיאה גבוהים שמגיעים ל־24.36.

אותה משפחה

MOSS-Audio יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לעבד קבצים בעברית?

המודל תומך רשמית באנגלית ובסינית בלבד לפי נתוני היצרן. הוא לא יזהה דיבור בעברית בצורה אמינה ולא מתאים לשימוש כזה ללא כוונון ייעודי.

במה גרסת ה־Thinking שונה מגרסת ה־Instruct הרגילה?

גרסת ה־Instruct עונה ישירות על הנחיות, בעוד גרסת ה־Thinking מייצרת תהליך חשיבה מפורט שמשפר הבנת הקשרים מורכבים במחיר של זמן תגובה ארוך יותר.

איך מריצים

המשקל הגולמי של הקבצים עומד על כמעט 17 גיגה־בייט, כך שתצטרכו כרטיס מסך בודד עם 24 גיגה זיכרון כדי להריץ אותו בנוחות ברמת דיוק מלאה. ההרצה המקומית נשענת על סביבת פייתון 3.12, חבילת ffmpeg 7, וקוד מותאם של SGLang אם רוצים שרת פרודקשן עם תמיכה בהאצת FlashAttention 2.

אם אתם צריכים רק תמלול מהיר בלי הסברים מנומקים, גרסת ה־Instruct הרגילה תעבוד מהר יותר ותצרוך פחות משאבים. הקמה עצמית שווה את המאמץ רק כשיש לכם צורך בפרטיות מוחלטת של ההקלטות או שליטה מלאה בשרשרת החשיבה, אחרת כדאי לבחון שירותי ענן קיימים.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-Audio-8B-Thinking

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי קוד והפצה מחודשת. אין חובה לחשוף קוד מקור סגור, והתנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗