GPT
M

MOSS-Audio-4B-Thinking

קוד פתוח

OpenMOSS-Teamapache-2.02026-04-11

  • safetensors
  • moss_audio
  • audio
  • speech
  • music

מודל אודיו שמנתח דיבור, צלילי סביבה ומוזיקה עם שרשרת חשיבה מובנית. מתאים למי שצריך תמלול מדויק בזמנים והסקת מסקנות מורכבת מקבצי קול בלי להחזיק שרת ענק.

  • 5.2Bפרמטרים
  • 9.7 GBמשקל הקבצים
  • 1,701הורדות בחודש
  • 37לייקים

מה זה

בבסיס יושב שילוב בין מקודד אודיו ייעודי שרץ ב־12.5 הרץ לבין שלד שפה של Qwen3-4B. המבנה מזריק תכונות משכבות מוקדמות של המקודד ישירות לשכבות השפה, ומשלב טוקנים של זמן בין הפריימים כדי להבין מה קרה ומתי. זה מאפשר לו להוציא תמלול עם זמנים מדויקים ברמת המילה והמשפט, לזהות רגשות ודוברים, ולנתח אירועים קוליים.

גרסת ה־Thinking מוסיפה חשיבה מרובת שלבים באודיו על בסיס אימון בחיזוקים. במבחני הבנה כללית הוא מציג דיוק ממוצע של 68.37 נקודות, גבוה מכל מודלי ה־7B הפתוחים שנבדקו בכרטיס. המשמעות היא שהוא תופס הקשרים מורכבים יותר משיחה רגילה, ולא רק פולט מילים שנאמרו.

מתאים ל

  • תמלול שיחות עם חותמות זמן

    המודל מוציא סנכרון זמנים מדויק ברמת מילה ומשפט בשיחות באנגלית.

  • ניתוח תוכן קולי מורכב

    מנגנון החשיבה מפרק שאלות מורכבות על הקלט ומזהה רגשות ודוברים לאורך זמן.

  • זיהוי אירועי שמע ורקע

    המקודד שומר על מאפייני צליל נמוכים לזיהוי כלי נגינה, רעשי סביבה ומקצב.

איפה זה נופל

הנתונים והאימונים נשענים על אנגלית וסינית בלבד. אין שום תיעוד או בדיקה לתמיכה בעברית, ולכן פרויקטים מקומיים ייתקלו בתמלול שבור לחלוטין אלא אם המטרה היא ניתוח מוזיקה או צלילי סביבה ללא שפה. בנוסף, מנגנון החשיבה מאט משמעותית את המענה ביחס למודלי תמלול ישירים. במבחני תמלול נקיים מודלים ייעודיים קטנים יותר עדיין מובילים בדיוק הגולמי.

אותה משפחה

MOSS-Audio יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לתמלול הקלטות בעברית?

לא. המודל אומן ונבדק על אנגלית וסינית בלבד. כל ניסיון לתמלל עברית ייכשל או יניב ג'יבריש.

מה ההבדל בין גרסת ה־Thinking לגרסת ה־Instruct?

גרסת ה־Instruct עונה ישירות ובמהירות על פקודות כמו תמלול או סיכום. גרסת ה־Thinking מפעילה שרשרת חשיבה פנימית שמתאימה להסבר אירועים מורכבים באודיו, אבל לוקחת יותר זמן לייצר תשובה.

איזה כרטיס מסך צריך כדי להריץ אותו בעבודה?

הקבצים שוקלים 9.7 גיגה בייט. כרטיס עם 16 גיגה זיכרון יספיק להסקה בסיסית, וכרטיס של 24 גיגה ייתן מרווח נשימה לקטעי אודיו ארוכים ולעבודה עם sglang.

איך מריצים

המשקלים תופסים 9.7 גיגה בייט, כך שכרטיס מסך בודד עם 16 או 24 גיגה זיכרון יריץ אותו בקלות. ההרצה המקומית נשענת על סביבת פייתון 3.12, ffmpeg 7 וגרסת פייטורץ' מותאמת עם תמיכה אופציונלית בפלאש אטנשן 2. למי שמקים שירות, הצוות הכין פיצול ייעודי של sglang שתומך בהגשה מהירה דרך שרת.

גרסת ה־Instruct מיועדת למענה ישיר ומהיר לפי פקודה, בעוד גרסת ה־Thinking מייצרת תהליך מחשבה לפני התשובה ולכן דורשת יותר זמן עיבוד לכל שאילתה. אם אתם צריכים תמלול פשוט בכמויות עצומות ללא צורך בהבנת רקע, שימוש ב־API ייעודי לתמלול יהיה זול ומהיר בהרבה מהחזקת שרת למודל חושב.

pip install -U huggingface_hub
hf download OpenMOSS-Team/MOSS-Audio-4B-Thinking

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים, בתנאי שמשאירים את הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗