GPT
C

chinese-hubert-large

קוד פתוח

TencentGameMatemit2022-06-02

  • transformers
  • pytorch
  • hubert
  • feature-extraction
  • endpoints_compatible

מודל לחילוץ ייצוגים וקטוריים מאודיו בסינית, שאומן מראש על עשרת אלפים שעות הקלטה. מתאים כבסיס למשימות עיבוד דיבור מתקדמות שדורשות הבנה אקוסטית עמוקה.

  • 4.7 GBמשקל הקבצים
  • 2,787הורדות בחודש
  • 45לייקים
  • 24שכבות

מה זה

מדובר במודל שמפרק קול ומייצר ממנו ייצוגים וקטוריים בסינית, ולא במנוע תמלול מוכן שעושה קסמים מהקופסה. טנסנט אימנו את גרסת הלארג' הזו, שמחזיקה 24 שכבות, על תת הקבוצה L של מאגר WenetSpeech שמכיל 10,000 שעות של שמע מגוון. המודל יודע לקלוט קובץ קול גולמי דרך חולץ המאפיינים הייעודי ולהוציא את המצבים הנסתרים של השכבה האחרונה, שמשקפים דפוסים פונטיים ומבניים של השפה.

ההבדל המרכזי מול מודלים רגילים לעיבוד שפה הוא שהאימון כאן התבסס כולו על אודיו טהור ללא טקסט וללא תיוגים. אין פה טוקנייזר ואין לו מושג איך לאיית מילים בכתב סיני או להחזיר תווים. במקום להתחרות במודלים מקצה לקצה שמייצרים טקסט ישיר, הוא נותן בסיס חזק למחקר או לפיתוח של מערכות מורכבות יותר, כמו זיהוי דוברים או סיווג רגשות, שבהן השלב הקריטי הוא הבנת האות הקולי עצמו לפני שמנסים להלביש עליו מילים.

מתאים ל

  • אימון מערכת תמלול בסינית

    כבסיס אקוסטי יציב שחוסך את הצורך באימון מקדים על כמויות ענק של אודיו, לפני הוספת שכבת טקסט.

  • זיהוי דוברים ואימות קולי

    חילוץ וקטורים אקוסטיים ברזולוציה גבוהה מתוך קבצי קול כדי להשוות בין קולות שונים.

  • סיווג רגשות ומקצב בדיבור

    הפקת ייצוגים פנימיים מהשכבות העמוקות שמכילים מידע על טונאליות ואופי הדיבור ללא תלות במלל.

איפה זה נופל

המודל הזה לא יודע לפלוט טקסט. אין בו טוקנייזר מובנה, ואם המטרה היא זיהוי דיבור, תצטרכו לבנות טוקנייזר בעצמכם ולאמן שכבות נוספות על גביו בעזרת דאטה מתויג של טקסט ושמע. מי שמחפש פתרון של לשלוח קובץ קול ולקבל מחרוזת יקבל רק מטריצות של מספרים. בנוסף, הוא אומן רק על סינית, כך שאין מה לנסות להריץ עליו שפות אחרות.

שאלות
נפוצות

אפשר לתמלל איתו הקלטות בסינית ישירות מהקופסה?

לא. המודל מחזיר רק וקטורים שמייצגים את האודיו ואין לו שכבת תרגום לאותיות או טוקנייזר. בשביל לקבל טקסט צריך לחבר לו ראש סיווג ולאמן אותו על מאגר מתויג.

האם הוא מתאים לזיהוי שפות אחרות חוץ מסינית?

האימון נעשה כולו על עשרת אלפים שעות של שמע בסינית מתוך WenetSpeech. הוא מותאם במיוחד לפונטיקה ולמאפיינים של השפה הזו, ולכן לא מומלץ להשתמש בו עבור שפות אחרות.

איך מריצים

כדי לעבוד איתו צריך סביבת פייתון עם transformers, soundfile ופייטורץ'. מורידים את המשקלים שתופסים כמעט 5 גיגה בייט, טוענים את חולץ המאפיינים Wav2Vec2FeatureExtractor יחד עם HubertModel, ומעבירים את השמע לחישוב בלי גרדיאנטים. הקוד הרשמי ממליץ להמיר את המודל והקלט לחצי דיוק כדי לחסוך זיכרון ולזרז את הריצה.

חומרה עם כרטיס מסך שמחזיק לפחות שמונה גיגה בייט זיכרון תספיק להסקה נוחה בחצי דיוק. אם היעד שלכם הוא רק לתמלל הקלטה בסינית לפרויקט נקודתי ולא לבנות מודל משלכם, עדיף להשתמש במודל תמלול שלם ומאומן מקצה לקצה או בשירות ענן קיים, במקום לתחזק שרת בשביל חילוץ מאפיינים שדורש שכבת פענוח נוספת.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="TencentGameMate/chinese-hubert-large")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 4.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של הקוד, אימון מחדש והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗