GPT
X

xcodec2

קוד פתוח

HKUSTAudiocc-by-nc-4.02025-01-07

  • pytorch
  • safetensors
  • xcodec2
  • audio-to-audio

מדובר במקודד דיבור שממיר אודיו לרצף טוקנים בודד בקצב של 50 טוקנים לשנייה ומשחזר אותו בחזרה. הוא מיועד למי שבונה מודלי שפה לדיבור וצריך ייצוג סמנטי בלי לוותר על איכות השמע.

  • 823Mפרמטרים
  • 13.9 GBמשקל הקבצים
  • 2,244הורדות בחודש
  • 101לייקים

מה זה

הארכיטקטורה כאן מחזיקה כ־823 מיליון פרמטרים ומשמשת כגשר בין עולם השמע לעולם מודלי השפה, ספציפית סביב מודלים כמו LLaSA. במקום להשתמש בכמה שכבות קוונטיזציה במקביל שמסבכות את מודל השפה, הוא עובד עם וקטור בודד שמייצר בדיוק 50 טוקנים לכל שניית שמע.

הוא יודע לקחת אות אודיו גולמי, לדחוס אותו למספרים שלוכדים משמעות סמנטית רב לשונית, ואז לקחת את המספרים האלה ולשחזר מהם קובץ קול שנשמע קרוב למקור. הדגש פה הוא על שילוב של סמנטיקה לצד איכות שחזור, כדי שמודלי שפה מבוססי טקסט יוכלו לייצר שמע בלי להישמע רובוטיים.

מתאים ל

  • אימון מודלי דיבור

    המרת קובצי קול לייצוג דיסקרטי כדי לאמן מודלים כמו LLaSA על 50 טוקנים לשנייה.

  • שחזור שמע מטוקנים

    הפיכת רצפי טוקנים סמנטיים חזרה לאודיו נשמע באיכות טובה בתדרי 16 קילו-הרץ.

  • מחקר אודיו רב-לשוני

    בדיקת יכולות דחיסה סמנטית של דיבור בשפות שונות עם שכבת קוונטיזציה בודדת.

איפה זה נופל

הקוד הפשוט מוגבל מאוד ומקבל רק קלט שמע בקצב דגימה של 16 קילו-הרץ, כך שכל קובץ אחר יחייב המרה מוקדמת. בנוסף, מימוש ההסקה הבסיסי תומך רק בקובץ אחד בכל פעם ולא מאפשר עיבוד מקבילי בלי לכתוב מעטפת מותאמת מקוד המקור. חוסר היציבות בין גרסאות החבילה, שהמפתח עצמו מציין בהוראות, דורש בדיקה קפדנית של התלויות כדי שלא יצוצו באגים בלתי צפויים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הרישיון שבו הוא שוחרר הוא רישיון לא-מסחרי בלבד, ולכן הוא מתאים רק לבדיקות, פיתוח פנימי ומחקר אקדמי. שימוש מסחרי מפר את תנאי הרישיון.

האם הוא מקבל קבצי שמע בכל איכות?

המודל תומך בדיבור בקצב דגימה של 16 קילו-הרץ בלבד. אם יש לכם קבצים באיכות שונה תצטרכו להמיר אותם לפני שמעבירים אותם לפונקציית הקידוד.

איך מריצים

כדי לעבוד איתו צריך סביבת פייתון 3.9 ולהתקין את החבילה הייעודית xcodec2, כאשר המפתח עצמו ממליץ על גרסה 0.1.3 אם מחפשים יציבות שתואמת לאימון המקורי. הקבצים שוקלים יחד 13.9 גיגה-בייט ומחולקים לעשרות קבצים, כך שצריך כרטיס מסך עם זיכרון סביר כדי להריץ את המודל לוקאלית לצד מודל השפה שמשתמש בו.

הסקריפט הבסיסי רץ ישירות על כרטיס המסך באמצעות פייטורץ', קורא קובץ אודיו בודד ומחזיר את הטוקנים ואת השחזור. אין פה כרגע תמיכה מובנית בריצה על כמה קבצים במקביל דרך הממשק הפשוט, ומי שצריך עיבוד בכמויות גדולות יצטרך לקחת את קוד המקור החיצוני שהחוקרים שחררו בגיטהאב.

pip install -U huggingface_hub
hf download HKUSTAudio/xcodec2

הקבצים

94 קבצים במאגר, 13.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה לצרכים מסחריים כלל. הוא פתוח למחקר, ניסויים ולמידה אישית בלבד, תוך מתן קרדיט ליוצרים. חברות או מפתחים שמתכננים להטמיע אותו במוצר שמייצר הכנסה לא יכולים לעשות זאת חוקית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗