GPT
C

chinese-wav2vec2-base

קוד פתוח

TencentGameMatemit2022-06-02

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • endpoints_compatible

זה מודל שמע בסיסי שאומן על עשרת אלפים שעות בסינית. הוא מיועד למי שרוצה נקודת זינוק לאימון מזהה דיבור עצמאי, בלי להתחיל מוקלט מאפס.

  • 1.4 GBמשקל הקבצים
  • 27,021הורדות בחודש
  • 66לייקים
  • 12שכבות

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Wav2Vec2 עם 12 שכבות, שחברת TencentGameMate שחררה אחרי אימון מקדים על תת הקבוצה L של מאגר WenetSpeech. הוא לא יודע לתמלל מילים ישר מהקופסה. המודל שמע המון סינית ולמד לייצג את האודיו ברמת הווקטורים, אבל אף אחד לא הצמיד לו טקסט בזמן האימון.

המשקל שלו עומד על 1.4 גיגה בייט בדיוק float32, שזה גודל קומפקטי לכל הדעות. אין פה ראש פענוח מוכן לטקסט ואין טוקנייזר. הערך שלו נמצא ביכולת לחסוך לכם את שלב הלימוד העצמי של השפה, כדי שתוכלו לקחת דאטה מתויג קטן יחסית ולאמן עליו משימה ספציפית בסינית.

מתאים ל

  • בסיס למזהה דיבור בסינית

    אימון מקדים על עשרת אלפים שעות חוסך זמן יקר כשבונים מערכת תמלול פנימית ייעודית.

  • חילוץ מאפייני שמע

    הפקת וקטורים איכותיים מקבצי קול בסינית לשימוש במודלים של סיווג דוברים או זיהוי רגש.

  • כוונון עדין למבטאים

    התאמת המודל לניבים או לתנאי הקלטה רועשים באמצעות כוונון על דאטה סט פרטי וקטן.

איפה זה נופל

החיסרון הברור ביותר הוא היעדר טוקנייזר. אי אפשר לזרוק אליו קובץ שמע ולקבל מחרוזת, כי הוא פשוט לא יודע אותיות או סימנים סיניים. תצטרכו לבנות טוקנייזר בעצמכם, להוסיף שכבת פלט מתאימה, ולאמן את הכול על מאגר נתונים מתויג של שמע וטקסט לפני שהוא יוכל לשמש לזיהוי דיבור. אם אין לכם נתונים מתויגים בסינית וזמן אימון, אין לכם מה לעשות איתו.

שאלות
נפוצות

אפשר להשתמש במודל הזה ישירות לתמלול הקלטות?

לא. המודל מכיל רק את ייצוג השמע הגולמי וללא טוקנייזר או שכבת פענוח טקסט. כדי להפיק ממנו מילים, חובה להוסיף טוקנייזר ולאמן אותו על קובצי קול עם תמלול תואם.

האם המודל מתאים לזיהוי שפות אחרות חוץ מסינית?

האימון נעשה כולו על מאגר WenetSpeech בסינית. אפשר טכנית לנסות לאמן אותו על שפות אחרות, אבל היעילות שלו מגיעה מההיכרות העמוקה עם הפונטיקה הסינית, ולכן לשפות אחרות כדאי לבחור מודל שאומן עליהן מראש.

איך מריצים

אתם מושכים אותו דרך transformers, כשהמפתחים מציינים עבודה מול גרסה 4.16.2 של הספרייה. בגלל שמדובר בגרסת base ששוקלת רק 1.4 גיגה בייט, לא צריך מפלצת מחשוב כדי לגעת בו. כרטיס מסך ביתי סביר או שרת ענן פשוט עם מעבד גרפי צנוע יספיקו כדי להריץ עליו כוונון עדין.

להריץ אותו לבד כמו שהוא לא ייתן שום תמלול, ולכן אין טעם לחפש לו API מוכן להחלפה. אם המטרה היא לקבל טקסט מסינית מחר בבוקר, עדיף להשתמש במודל מתומלל מוכן או בשירות תמלול קיים במקום להשקיע משאבים באימון הראש החסר.

from transformers import pipeline

pipe = pipeline("text-generation", model="TencentGameMate/chinese-wav2vec2-base")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא MIT. זה רישיון פתוח ומתירני מאוד שמאפשר לכם להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו ולשלב אותו במוצרים שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗