GPT
C

chinese-hubert-base

קוד פתוח

TencentGameMatemit2022-06-02

  • transformers
  • pytorch
  • hubert
  • feature-extraction
  • endpoints_compatible

מודל בסיס לחילוץ מאפיינים מאודיו בסינית שאומן על עשרת אלפים שעות הקלטה. הוא נותן נקודת זינוק טובה למי שבונה זיהוי דיבור עצמאי ורוצה לחסוך אימון ראשוני כבד.

  • 1.4 GBמשקל הקבצים
  • 41,717הורדות בחודש
  • 45לייקים
  • 12שכבות

מה זה

מדובר בארכיטקטורת HuBERT עם 12 שכבות שמיועדת למשימת חילוץ מאפיינים ופורסמה על ידי TencentGameMate. האימון המקדים נעשה על תת המאגר L של WenetSpeech, שמכיל עשרת אלפים שעות אודיו בסינית בלבד, כך שהוא מבין את הניואנסים הפונטיים של השפה טוב יותר ממודלים כלליים.

המודל מוציא ייצוג וקטורי של גלי הקול ולא טקסט. בשונה ממודלים שכוללים ראש פענוח שלם, כאן מקבלים רק את הבסיס שמעבד את האודיו הגולמי דרך חילוץ מאפיינים של Wav2Vec2, ומשם צריך לבנות לבד את שכבות ההמשך למשימה הספציפית שלכם.

מתאים ל

  • בסיס למערכת זיהוי דיבור

    נקודת מוצא לאימון מודל תמלול בסינית על ידי הוספת טוקנייזר ושכבת פלט מותאמת.

  • חילוץ וקטורים לקול בסינית

    ייצוג אודיו מספרי מדויק עבור משימות סיווג דוברים או זיהוי רגשות בהקלטות.

  • אימון המשך על מאגר ייעודי

    המשך pretraining עם קוד Wav2Vec2ForPreTraining על נתוני אודיו ייחודיים שלכם.

איפה זה נופל

המודל הזה לא מתמלל מילה אחת מהקופסה. אין לו טוקנייזר כי הוא אומן על אודיו בלבד בלי טקסט, כך שאי אפשר לקבל ממנו טקסט בלי ליצור טוקנייזר מאפס ולאמן אותו עם נתונים מתויגים. בנוסף, הוא מתמקד כולו בסינית, מה שהופך אותו לחסר תועלת לפרויקטים בעברית או באנגלית.

שאלות
נפוצות

אפשר לתמלל איתו הקלטות מיד אחרי ההורדה?

לא. המודל מחזיר רק וקטורים ולא מילים, ואין לו טוקנייזר פנימי. כדי לקבל תמלול צריך לבנות טוקנייזר ולאמן שכבות נוספות על טקסט מתויג.

האם הוא יעבוד טוב על הקלטות בעברית?

לא, הוא אומן על עשרת אלפים שעות בסינית בלבד ממאגר WenetSpeech. שימוש בו לשפות אחרות ייתן תוצאות גרועות מאוד ועדיף לבחור מודל רב לשוני.

איך מריצים

טוענים אותו דרך ספריית transformers בגרסה 4.16.2 יחד עם soundfile לחיתוך האודיו. קבצי המשקלים תופסים כ־1.4 גיגה בייט בדיוק של float32, ואפשר להמיר אותם ל־half כדי לחסוך זיכרון ולהריץ בקלות על כרטיס מסך פשוט או אפילו על מעבד סביר.

אם אתם רק צריכים תמלול מוכן של אודיו בסינית בלי התאמות, עדיף להשתמש ב־API מסחרי מוכן. הרצה עצמית פה שווה את הזמן רק כשאתם מאמנים מודל משלכם וצריכים שליטה מלאה בנתונים ובייצוג הווקטורי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="TencentGameMate/chinese-hubert-base")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו במוצר שלכם בלי תשלום. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗