GPT
H

higgs-audio-v2-tokenizer

קוד פתוח

bosonaiother2025-06-23

  • transformers
  • safetensors
  • higgs_audio_v2_tokenizer
  • feature-extraction
  • endpoints_compatible

הטוקנייזר הזה דוחס אודיו בדיד בקצב של 25 פריימים לשנייה בלבד. הוא מתאים למי שרוצה לאמן מודלי שפה על אודיו בלי לחנוק את חלון ההקשר.

  • 201Mפרמטרים
  • 768 MBמשקל הקבצים
  • 105,641הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל שממיר קובצי קול ברזולוציה של 24kHz לטוקנים בדידים, ובחזרה לאודיו דרך מפענח ישיר ללא דיפוזיה. הייחוד העיקרי שלו מול כלים ותיקים הוא האימון המשותף על דיבור, מוזיקה ואפקטים קוליים יחד, במקום להחזיק מודל נפרד לכל סוג תוכן. הוא שומר על קצב נתונים של 2kbps, שזה חצי או רבע מחלק ניכר מהחלופות.

במבחני השוואת שגיאות מול מקור, מודלים כמו DAC עדיין מציגים שחזור מדויק יותר, אבל הם עושים את זה בקצב נתונים של פי 12 ממנו. לעומת זאת, במדדי הערכה אסתטיים ובדיוק סמנטי באנגלית ובסינית, הוא עוקף את רוב המודלים שפועלים בקצבים נמוכים דומים. המשמעות בפועל היא פחות טוקנים למודל השפה בלי לאבד את מובנות המילים או להרוס את גוון הצליל.

מתאים ל

  • אימון מודלי שפה לאודיו

    קצב של 25 פריימים לשנייה חוסך טוקנים רבים בחלון ההקשר בזמן אימון.

  • דחיסת קול מהירה

    מפענח ללא דיפוזיה שמחזיר אודיו מקודד במהירות על חומרה צנועה.

  • עיבוד אודיו מעורב

    מודל יחיד שיודע לעבוד עם דיבור, מוזיקה ואפקטים בלי להחליף משקלים.

איפה זה נופל

השחזור האקוסטי המוחלט שלו עדיין נופל משמעותית ממודלים כמו DAC, כך שאם אתם עובדים על פרויקט שדורש דיוק אולפני מושלם, הירידה באיכות תורגש. בנוסף, בדיקות הסמנטיקה הרשמיות שלו נמדדו רק באנגלית ובסינית, ולכן איכות שימור המידע בשפות אחרות, כולל עברית, אינה ידועה ודורשת בדיקה עצמאית לפני שמשלבים אותו במערכת.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות דרך transformers?

כן, המודל נתמך רשמית מהספרייה מגרסה 5.3.0 ומעלה. כל מה שצריך זה לעדכן את החבילה ולטעון את המזהה כרגיל.

איך המודל מתמודד עם עברית?

דפי הבדיקה מציגים נתונים על אנגלית וסינית בלבד במסגרת SeedTTS. אין נתונים על שפות אחרות, ותצטרכו לבדוק את שימור המילים בעברית בעצמכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 768MB, עם 201 מיליון פרמטרים בלבד. הוא נתמך ישירות בספריית transformers מגרסה 5.3.0 ומעלה, כך שמספיק להתקין את החבילה דרך pip ולהריץ אותו ישירות מקוד פייתון פשוט.

מבחינת חומרה, המודל הזה רץ בקלות על כל כרטיס מסך בסיסי עם 2GB זיכרון, וגם על מעבד רגיל של שרת זול. אין פה שלב דיפוזיה כבד, מה שהופך את המעבר להסקה מהירה במיוחד בקבוצות נתונים. אין צורך לחפש API חיצוני כדי לקרוא לו, הרצה מקומית תהיה זולה ופשוטה יותר.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="bosonai/higgs-audio-v2-tokenizer")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 768 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מסומן תחת רישיון other. המשמעות היא שאין כאן רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, וחובה לבדוק את תנאי השימוש המדויקים במאגר של boson ai בגיטהאב לפני הפצה של מוצר מסחרי כדי להימנע מסיבוכים משפטיים.

הרישיון המלא בעמוד המודל ↗