GPT
E

encodec_24khz

קוד פתוח

facebookרישיון לא דווח2023-06-12

  • transformers
  • pytorch
  • safetensors
  • encodec
  • feature-extraction

דחיסת אודיו עצבית בזמן אמת שמספקת איכות גבוהה בקצבי נתונים נמוכים במיוחד. מתאים למי שבונה יישומי קול או הזרמה וחייב לחסוך ברוחב פס בלי לחסל את הסאונד.

  • 23Mפרמטרים
  • 178 MBמשקל הקבצים
  • 232,111הורדות בחודש
  • 57לייקים

מה זה

מטא בנתה קודק שמבוסס על רשת נוירונים ומיועד לדחיסה ולשחזור של אודיו בקצב דגימה של 24kHz. המבנה כולל אנקודר ודקודר עם מרחב לטנטי מקוונטט, ומשתמש במודל מתחרה מבוסס ספקטרוגרמה כדי לצמצם רעשים וארטיפקטים. הוא מסוגל לעבוד בקצבי נתונים גמישים כמו 1.5, 3, 6 או 12 kbps, וכולל אפשרות לדחיסה נוספת של 25 עד 40 אחוזים בעזרת מודל שפה קל על גבי הקודים.

במבחני האזנה סובייקטיביים של MUSHRA, המודל עקף קודקים מסורתיים בקצבים מקבילים. התוצאות מראות שבקצב של 3 kbps הוא מגיע בממוצע לאיכות טובה יותר ממה ש־Lyra-v2 מספק ב־6 kbps או Opus ב־12 kbps. המשמעות בפועל היא חיסכון דרסטי בתעבורת רשת תוך שמירה על דיבור ומוזיקה נקיים, במיוחד בחיבורים איטיים.

מתאים ל

  • דחיסת שיחות קוליות

    העברת קול בזמן אמת ברוחב פס מינימלי של 3 kbps תוך שמירה על מובנות גבוהה.

  • הפקת טוקנים למודלי אודיו

    חילוץ ייצוגים דחוסים מקבצי קול כבסיס למודלי שפה שמייצרים דיבור או מוזיקה.

  • אחסון ארכיוני של דיבור

    כיווץ נפח אחסון של הקלטות שמע פי כמה בהשוואה לקודקים סטנדרטיים בלי לאבד פרטים קריטיים.

איפה זה נופל

המודל אומן על מקטעים קצרים של שנייה אחת מתוך מאגרי דיבור ומוזיקה כמו DNS Challenge 4, AudioSet ו־Jamendo, עם ערבוב מקורות ונרמול עוצמה קבוע. הוא לא מיועד לאודיו מורכב בקצבי דגימה גבוהים יותר מ־24kHz, והוא מוגבל לערוץ מונו יחיד בגרסה זו. בנוסף, מנגנון חלוקת המקטעים עלול ליצור קטיעות קלות בחיבורים אם לא מנהלים נכון את הריפוד והחפיפה באפליקציה שלכם.

שאלות
נפוצות

האם צריך GPU כדי להריץ את המודל בפרודקשן?

לא. המודל שוקל 178 מגה בייט וכולל 23 מיליון פרמטרים בלבד. הוא תוכנן לעבודה בזמן אמת ומסוגל לרוץ ביעילות על מעבד סטנדרטי בלי לייצר עומס כבד על השרת.

איך המודל מתמודד עם מוזיקה ביחס לקול אנושי?

האימון שילב קטעי מוזיקה ממאגר Jamendo לצד מאגרי דיבור. המודל יודע לדחוס מוזיקה, אבל התוצאה בגרסה הזו מוגבלת למונו ובקצב דגימה של 24kHz, כך שהיא לא תחליף קודקים שמיועדים להאזנה באיכות אולפן.

איך מריצים

עם 23 מיליון פרמטרים ומשקל קובץ של 178 מגה בייט, המודל רץ ישירות על מעבד רגיל בלי שום צורך במאיץ גרפי ייעודי. סביבת פייתון פשוטה עם ספריית transformers מספיקה כדי לטעון אותו, ולכן אין שום היגיון כלכלי לשלם ל־API חיצוני על פעולה קלה כזו.

בזמן ההרצה בוחרים בין שני מצבים: מצב ללא הזרמה שמחלק את האודיו למקטעים של שנייה אחת עם חפיפה של 10 מילישניות, ומצב הזרמה שמבוסס על נרמול משקלים בשכבות הקונבולוציה וריפוד משמאל. אם אתם בונים מערכת בזמן אמת, מצב ההזרמה הוא הדרך הנכונה לעבוד כדי להימנע מהשהיות מיותרות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/encodec_24khz")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 178 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון שימוש. מבחינה משפטית, היעדר רישיון מוגדר אומר שאין לכם הרשאה מפורשת להפיץ אותו, להטמיע אותו במוצר מסחרי או להשתמש בו בסביבת ייצור. מומלץ לבדוק את הרישיון במאגר המקורי בגיטהאב לפני שמשלבים אותו בקוד של החברה.

הרישיון המלא בעמוד המודל ↗