GPT
M

MiMo-Audio-Tokenizer

קוד פתוח

XiaomiMiMomit2025-09-18

  • safetensors

זהו טוקנייזר אודיו שממיר גלי קול לרצף טוקנים בדידים עבור מודלי שפה, במקום להסתמך על ייצוגים קיימים. הוא מתאים למי שבונה ארכיטקטורת שמע מקצה לקצה וצריך שלב המרה יעיל ומאומן היטב.

  • 1.3Bפרמטרים
  • 3.6 GBמשקל הקבצים
  • 5,224הורדות בחודש
  • 40לייקים

מה זה

מדובר ברכיב שמבוסס על ארכיטקטורת טרנספורמר בגודל של כמעט 1.3 מיליארד פרמטרים, קצב דגימה של 25 הרץ, ומחסנית RVQ של שמונה שכבות. המבנה הזה מייצר 200 טוקנים לכל שניית שמע. שיאומי אימנו אותו מאפס על עשרה מיליון שעות שמע, תוך שילוב בין יעדי שחזור צליל לבין שימור משמעות סמנטית.

התפקיד העיקרי שלו הוא לשמש חוליה מקשרת עבור מודלים גדולים יותר בסדרה, כמו גרסאות ה־7B שלהם. במקום להזין גלי קול גולמיים או להסתפק רק בספקטרוגרמות, המודל דוחס את המידע כדי לאפשר למודל השפה לטפל בשמע באותה צורה שבה הוא מנחש את הטוקן הבא בטקסט.

מתאים ל

  • קידוד שמע למודלי שפה

    המרת דיבור ל־200 טוקנים בשנייה לצורך הזנה ישירה למודלי שפה של אודיו.

  • שחזור אותות דיבור

    דחיסה ושחזור של קובצי קול באיכות גבוהה על בסיס שמונה שכבות קוונטיזציה.

  • מחקר ארכיטקטורות קול

    בניית מודלים מותאמים אישית שמשלבים מטרות סמנטיות ומטרות שחזור צליל.

איפה זה נופל

הטוקנייזר הזה אינו מודל שפה עצמאי, ואם תריצו אותו בפני עצמו תקבלו רק קידוד ושחזור של שמע ללא יכולות עיבוד, שיחה או תמלול. הכרטיס מציין שרצף הטוקנים שהוא מייצר דורש מנגנוני כיווץ נוספים, כמו איחוד צעדי זמן באמצעות פאצ'ים, כדי שמודל שפה יוכל להתמודד עם אורך הרצף.

בנוסף, המידע בכרטיס המודל לא מפרט אילו שפות נכללו בעשרת מיליוני שעות האימון, כך שאין שום הבטחה לגבי איכות השחזור של דיבור בעברית או תחת רעשי רקע מורכבים.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כמודל לתמלול או שיחה?

לא. זהו טוקנייזר בלבד שתפקידו להמיר אות שמע לייצוג ספרתי של טוקנים ובחזרה. בשביל להבין הוראות או לנהל שיחה, חובה לחבר אותו למודל שפה מתאים כמו גרסת ה־7B בסדרה.

האם המודל שומר על איכות טובה בעברית?

בתיעוד הרשמי לא מצוין הרכב השפות ששימש לאימון עשרת מיליוני השעות. מומלץ לקודד ולשחזר דגימות קול בעברית כדי לבדוק אם המבטא והאיכות נשמרים לפני שמתבססים עליו בפיתוח.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.6 גיגה-בייט, כך שמבחינת זיכרון מדובר במודל קל יחסית שכל כרטיס מסך מודרני עם 6 עד 8 גיגה זיכרון יכול להחזיק בלי מאמץ. כדי להפעיל אותו בסביבה מלאה, מתקינים את המאגר הרשמי מגיטהאב ומריצים את ממשק הגראדיו המובנה או את סקריפטי ההסקה שמסופקים שם.

חשוב לזכור שהרצת הטוקנייזר לבדו לא תיתן לכם שיחה או הבנה של שמע, אלא רק המרה מטקסט וסאונד לייצוג טוקנים ובחזרה. אם אתם צריכים מערכת קולית מוכנה בלי להתעסק עם חיבור שרשרת מודלים מקומית, פנייה לשירות ענן מוכן תחסוך את כל הסיבוך הזה.

pip install -U huggingface_hub
hf download XiaomiMiMo/MiMo-Audio-Tokenizer

הקבצים

4 קבצים במאגר, 3.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות, הפצה ושילוב בתוך מוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗