GPT
C

cmu-arctic-xvectors

קוד פתוח

Matthijsmit2023-02-07

המאגר מרכז וקטורי מאפייני קול מוכנים מראש מתוך הקלטות פרויקט ארקטיק. במקום להריץ מודלים כבדים לחילוץ ייצוג דובר, מקבלים ערכים מספריים מוכנים למשימות דיבור.

  • 19,117הורדות בחודש
  • 64לייקים

מה זה

במאגר תמצאו 7,931 קבצים בפורמט npy, כאשר כל קובץ מייצג היגד בודד מתוך מאגר ההקלטות של פרויקט CMU ARCTIC הוותיק. כל רשומה כזו מכילה וקטור מסוג X-vector באורך 512 מספרים, שמתאר את הגוון והמאפיינים הקוליים של הדובר באותה הקלטה.

ההיגדים המקוריים נלקחו משבעה דוברים שונים בלבד: גבר ואישה מארצות הברית תחת הכינויים bdl ו־slt, גבר קנדי בשם jmk, גבר סקוטי awb, גבר אמריקאי נוסף rms, אישה אמריקאית clb, וגבר הודי שמסומן כ־ksp. החילוץ נעשה בעזרת מודל spkrec-xvect-voxceleb של ספריית speechbrain, דרך סקריפט ייעודי שהכינו עבור המודל speecht5-vc, ללא שלבי סינון מיוחדים שמתוארים מעבר לכך.

מתאים ל

  • אימון SpeechT5 לסינתזה

    הזנת וקטור הדובר לשליטה על זהות הקול במודלי דיבור שתומכים בהתניה חיצונית.

  • המרת קול בין דוברים

    שימוש בייצוגי שבעת הדוברים לצורך מיפוי קול ממקור ליעד במשימות המרת אודיו.

  • בדיקת זיהוי דוברים

    השוואת מרחקים בין וקטורים כדי לבחון אלגוריתמים שמבדילים בין שבעת המשתתפים.

איפה זה נופל

ההגבלה הראשונה היא היעדר גיוון קיצוני. יש פה שבעה דוברים ספציפיים בלבד, כולם דוברי אנגלית במבטאים שונים, ללא ייצוג לשפות אחרות או לעברית. בנוסף, מדובר בווקטורים שחולצו מראש ממודל מסוים, כך שאתם כבולים להנחות ולארכיטקטורה של speechbrain ואינכם מקבלים את קבצי האודיו הגולמיים בתוך החבילה הזו. אם המודל שלכם דורש התאמה לרעשי רקע או איכות שונה, הנתונים המעובדים כאן לא יספיקו.

שאלות
נפוצות

האם מותר להשתמש בזה למוצר מסחרי?

כן, הרישיון הוא רישיון MIT חופשי ומתיר שימוש מסחרי מלא. עליכם לכלול את קובץ הרישיון ומתן הקרדיט המקורי במסמכי הפרויקט. אין חובה לחלוק את הקוד שתפתחו או את תוצרי האימון.

האם יש במאגר הקלטות בעברית?

לא, המאגר מבוסס כולו על הקלטות באנגלית ממספר מבטאים מצומצם. אין כאן שום קובץ או דובר בעברית. אם אתם בונים מערכת למבטא ישראלי או לשפה המקומית, תצטרכו להפיק וקטורים עצמאית מדאטהסט אחר.

מה בדיוק מקבלים כשמורידים את הדאטהסט?

לא מקבלים גלי קול בפורמט WAV אלא קבצי npy מוכנים לפייתון. כל קובץ כזה שומר מערך של 512 ערכים שמייצגים את טביעת הקול של הדובר. סך הכל ישנם 7,931 קבצים שמקושרים להיגדים שנותחו.

איך הנתונים האלה נוצרו?

היוצר לקח את פרויקט CMU ARCTIC הידוע והעביר את כל המשפטים שלו דרך מודל קיים של speechbrain שנקרא spkrec-xvect-voxceleb. המודל הזה מחשב את הווקטור שמייצג את גוון הקול עבור כל משפט שנאמר.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה של פייתון, בפקודת load_dataset עם ציון המזהה והחלוקה validation. הגישה חופשית לגמרי ואין צורך באישור מיוחד. המאגר עצמו כולל ארבעה קבצים, כולל ארכיון הנתונים spkrec-xvect.zip וסקריפט טעינה, והשדה המרכזי שמעניין אתכם ברשומה הוא xvector, אותו ממירים ישירות לטנזור כדי להזין למודל.

from datasets import load_dataset

ds = load_dataset("Matthijs/cmu-arctic-xvectors")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, לאמן עליו מודלים ולשלב אותו במערכות פנימיות. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בתוכנה שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗