GPT
M

MOSS-Audio-Tokenizer

קוד פתוח

OpenMOSS-Teamapache-2.02026-02-04

  • transformers
  • safetensors
  • moss-audio-tokenizer
  • feature-extraction
  • audio

דוחס אודיו של 24kHz לקצב נמוך במיוחד של 12.5Hz בלי רשתות קונבולוציה. פתרון ממוקד למי שבונה מודלי שפה לאודיו וצריך ייצוג בדיד עם איכות שחזור גבוהה.

  • 1.8Bפרמטרים
  • 6.6 GBמשקל הקבצים
  • 202,032הורדות בחודש
  • 46לייקים

מה זה

מדובר במקודד ומפענח אודיו מבוסס טרנספורמר סיבתי מלא בהיקף של כמעט 1.8 מיליארד פרמטרים. הוא לוקח גל קול גולמי והופך אותו לרצף טוקנים בדידים באמצעות מנגנון קוונטיזציה של 32 שכבות, מה שמאפשר שליטה בקצב המידע מ־0.125 עד 4 קילו-ביט לשנייה. האימון נעשה מאפס על שלושה מיליון שעות של דיבור, מוזיקה ואפקטים קוליים, בלי להישען על מודלים מוקדמים כמו וויספר.

במדדי השחזור, המודל מציג יתרון עקבי על פני חלופות כמו Mimi או Encodec באותם רוחבי פס. בקצב של 1000bps הוא מגיע לציון דמיון קול של 0.88 באנגלית ו־0.81 בסינית, עם PESQ פס רחב של 2.87, פער ניכר מול המתחרים שנעים באזורי ה־2.2 עד 2.5. המשמעות המעשית היא פחות רעשי רקע ועיוותים בשחזור, לצד שמירה על תוכן סמנטי שמתאים למשימות הבנה ויצירה.

מתאים ל

  • טוקניזציה למודלי דיבור

    מייצר טוקנים בדידים בקצב של 12.5Hz בלבד, מה שמקצר את אורך הרצף עבור מודלי שפה שמפיקים או מבינים קול.

  • הזרמת קול בזמן אמת

    המבנה הסיבתי מאפשר קידוד ופענוח בחלונות קצרים של 0.08 שניות בלי להמתין לסיום כל קובץ הקול.

  • דחיסת קול לרוחב פס נמוך

    מאפשר כיוונון קצב שידור עד 0.125kbps תוך שמירה על רמת מובנות גבוהה של הדיבור.

איפה זה נופל

הזרמת האודיו מוגבלת לפיסת מידע בודדת בכל קריאה, מה שמקשה מאוד על עיבוד במקביל ביישומי שרת עמוסים. בנוסף, חלון הזמן חייב להתחלק בדיוק בקצב הדגימה הפנימי של 1920 דגימות.

נקודת תורפה בולטת היא שאין בדיקות או נתונים על שפות שאינן אנגלית או סינית. כל מבחני הדיבור בכרטיס המודל נמדדו על LibriSpeech ועל AISHELL-2 בלבד. לפני שמשלבים אותו במערכת שמטפלת בעברית, חובה לבדוק ידנית אם העיצורים והאינטונציה המקומית שורדים את הדחיסה בלי עיוותים קשים.

שאלות
נפוצות

האם המודל מתאים לשחזור מוזיקה או רק דיבור?

הוא אומן על מגוון סוגי אודיו כולל מוזיקה ואפקטים, ובקצבים של 2000bps ומעלה מציג מדדי שגיאת תדר נמוכים. עם זאת, הוא מכוון בעיקר לדחיסה יעילה, ובקצבים נמוכים מאוד תרגישו ירידה בפרטים המוזיקליים.

למה הטעינה מחייבת trust_remote_code?

המימוש הנוכחי נשען על קבצי פייתון שמגיעים ישירות ממאגר המודל ולא מקוד ליבה שכבר הוטמע רשמית בספריית transformers. זה אומר שאתם מריצים קוד שנמשך מהרשת, ויש לוודא שסביבת הריצה שלכם מאפשרת זאת מבחינת אבטחה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־6.6 גיגה-בייט. תצטרכו כרטיס מסך עם לפחות 16 גיגה-בייט של זיכרון כדי להריץ קידוד ופענוח בלי להיתקל במגבלות זיכרון, במיוחד בגלל מבנה הטרנספורמר המלא.

הקוד נטען דרך ספריית transformers הרגילה אבל דורש הרצת קוד מרוחק עם trust_remote_code. יש תמיכה בהזרמה ישירה בחלונות של 0.08 שניות, אבל היא עובדת רק עם batch_size של 1, כך שאם אתם מתכננים שרת עיבוד בקצב גבוה לכמה משתמשים במקביל, תצטרכו לנהל את התור בעצמכם.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="OpenMOSS-Team/MOSS-Audio-Tokenizer")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗