GPT
E

encodec_48khz

קוד פתוח

facebookmit2023-06-12

  • transformers
  • pytorch
  • safetensors
  • encodec
  • feature-extraction

קודק שמע מבוסס רשתות נוירונים שדוחס ומחלץ אותות בקצב דגימה של 48 קילו-הרץ בזמן אמת. הוא מיועד למי שצריך דחיסה קיצונית של מוזיקה או דיבור בלי לאבד איכות צליל גבוהה.

  • 19Mפרמטרים
  • 146 MBמשקל הקבצים
  • 8,027הורדות בחודש
  • 36לייקים

מה זה

מדובר במודל דחיסה שממיר אותות שמע לייצוג מקודד דחוס ומחזיר אותם לסאונד רציף. הוא כולל ארכיטקטורת קידוד ופענוח עם מרחב לטנטי מכומת, ועושה שימוש ברשת יריבה על ספקטרוגרמות כדי להפחית ארטיפקטים של צליל. המודל מתאים לדחיסה בזמן אמת ותומך במגוון רוחבי פס מוגדרים מראש כמו 1.5, 3, 6 ו־12 קילו-ביט לשנייה.

בבדיקות האזנה לפי מתודולוגיית מושרא, המודל הציג ציוני איכות תפיסתית גבוהים יותר מקודקים מקובלים באותם רוחבי פס. למשל, ברוחב פס של 3 קילו-ביט לשנייה הוא עקף את אופוס ב־12 קילו-ביט ואת לירה ב־6 קילו-ביט, מה שמעיד על חיסכון משמעותי מאוד בנפח התעבורה הנדרש להעברת שמע מבלי לשלם בצרידות או בעיוותים גסים.

מתאים ל

  • הזרמת מוזיקה ברוחב פס נמוך

    דחיסה כבדה ששומרת על תדר 48 קילו-הרץ וחוסכת משמעותית בעלויות תעבורה.

  • העברת קול בזמן אמת

    מצב הזרמה מובנה שמאפשר עיבוד רציף לשיחות קוליות בחיבורי אינטרנט איטיים.

  • חילוץ ייצוגים למודלי קול

    שימוש במרחב הלטנטי המכומת כקלט למודלים מבוססי שפה ליצירת דיבור או סאונד.

איפה זה נופל

אם אתם עובדים עם מקטעים, החלוקה לחתיכות של שנייה אחת עם חפיפה עלולה ליצור בעיות רציפות אם לא מטפלים בה נכון בקוד. המודל אמנם נבדק מול מאגרי קול ומוזיקה מגוונים, אך בדחיסה אגרסיבית של 1.5 קילו-ביט עדיין יש ירידה מורגשת באיכות ביחס לאות המקורי, במיוחד בתדרי מוזיקה עשירים. יש לבחון אותו היטב על סוגי השמע הספציפיים שלכם לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם המודל דורש כרטיס גרפי ייעודי כדי לפעול בזמן אמת?

לא. עם 19 מיליון פרמטרים וגודל קובץ של 146 מגה-בייט, מדובר במודל קל מאוד שמסוגל לרוץ בזמן אמת גם על גבי מעבדים רגילים ללא תלות במאיץ גרפי חזק.

איך בוחרים בין מצב הזרמה למצב מקטעים?

אם אתם בונים מערכת לשידור חי או שיחה שבה השהייה היא קריטית, משתמשים במצב הזרמה. אם אתם מעבדים קבצים קיימים מראש, מצב המקטעים של שנייה אחת פשוט יותר למימוש.

איך מריצים

המודל שוקל בסך הכול 146 מגה-בייט וכולל 19 מיליון פרמטרים בדיוק של 32 ביט. המשמעות היא שאין שום צורך בחומרת שרתים כבדה כדי להריץ אותו, וכל כרטיס גרפי פשוט או מעבד מודרני ממוצע יכולים לעשות את פעולות הקידוד והפענוח בקלות ובזמן אמת דרך ספריית הטרנספורמרס.

אפשר להשתמש במודל בשני מצבים, מצב הזרמה עם ריפוד שמאלי שמתאים לשידור חי, או מצב של חלוקה למקטעים בני שנייה אחת עם חפיפה של 10 מילי-שניות. בגלל המשקל הזעיר ומהירות החישוב, אין שום היגיון לשלם ל־API חיצוני או לשלוח את האודיו ברשת לספק צד שלישי כשאפשר להריץ אותו לוקאלית בתוך התהליך שלכם.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/encodec_48khz")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 146 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אם-אי-טי פשוט ומתירני לחלוטין. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לשלב אותו בתוכנה קניינית ולהפיץ אותו ללקוחות, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מטא בתוך הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗