GPT
H

hubert-base-ls960

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • hubert
  • feature-extraction

חילוץ ייצוגים וקטוריים מקבצי אודיו באנגלית עבור משימות קוליות מותאמות אישית. מתאים כבסיס גולמי שדורש כוונון נוסף עם טקסט.

  • 720 MBמשקל הקבצים
  • 517,465הורדות בחודש
  • 75לייקים
  • 12שכבות

מה זה

מדובר במודל שומע של 12 שכבות שאומן מראש בלמידה עצמית על 960 שעות של דיבור באנגלית מתוך Librispeech. הוא לא פולט טקסט ולא מתמלל שום דבר ישר מהקופסה. התפקיד שלו הוא לקחת גלי קול ולתרגם אותם לייצוגים וקטוריים עשירים, שמשלבים מידע אקוסטי ומבנה שפתי שנלמד דרך ניבוי יחידות מושתקות.

השיטה של פייסבוק כאן משתמשת בקלאסטרינג של k-means כדי לייצר תוויות מטרה בזמן האימון, מה שמביא אותו לרמת ביצועים שמשתווה או עוקפת את wav2vec 2.0 במבחני דיוק. במקום לקבל כלי תמלול גמור, מקבלים בסיס מוצק שנועד לעבור כוונון עדין עם טוקנייזר וטקסט מתויג.

מתאים ל

  • אימון מודל תמלול ייעודי

    בסיס מצוין להוספת שכבת CTC וטוקנייזר כדי לתמלל אנגלית מותאמת לדומיין מסוים.

  • חילוץ מאפיינים מקול

    המרת גלי קול של 16kHz לוקטורים עבור משימות סיווג רגש או זיהוי דוברים.

  • מחקר ועיבוד דיבור

    בדיקת ייצוגים אקוסטיים שנלמדו מראש בלי צורך להשקיע אלפי שעות אימון מאפס.

איפה זה נופל

המודל הזה לא יודע עברית. הוא אומן אך ורק על דיבור באנגלית, וכל האודיו שנכנס אליו חייב להיות בקצב דגימה של 16 קילוהרץ בלבד. בנוסף, אין לו טוקנייזר מובנה ואי אפשר להוציא ממנו מילים כתובות בלי אימון נוסף על נתונים מתויגים. אם תזינו הקלטות באיכות שונה או תצפו לקבל טקסט ישירות, תקבלו שגיאות או פלט חסר תועלת.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות לתמלול הקלטות?

לא. המודל חולץ מאפיינים בלבד ואין לו טוקנייזר מובנה. כדי לקבל תמלול צריך להוסיף ראש סיווג כמו HubertForCTC ולאמן אותו על טקסט מתויג.

האם הוא יעבוד על קבצי קול בעברית?

הוא אומן על קורפוס Librispeech באנגלית בלבד. הרצה שלו על עברית תניב ייצוגים לא מותאמים שלא נבנו עבור הפונטיקה של השפה.

מה הדרישה הקריטית ביותר לגבי קובץ הקול שנכנס אליו?

קובץ האודיו חייב לעבור דגימה מחדש ל־16kHz לפני ההזנה למודל. הזנת קצב דגימה אחר תפגע לחלוטין בחישוב המאפיינים.

איך מריצים

המשקל עומד על 720 מגה בייט, כך שאפשר להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך בסיסי מאוד בלי לשבור את הראש על זיכרון. טוענים אותו ישירות דרך ספריית transformers בפייתון, וכדי להוציא ממנו תמלול בפועל מחליפים את המחלקה הרגילה ב־HubertForCTC ומוסיפים ראש סיווג משלכם.

אם אתם צריכים תמלול מהיר מהמדף באנגלית ולא רוצים לאמן שכבות בעצמכם, עדיף לפנות למודל שכבר עבר fine-tuning או ל־API חיצוני. המודל הזה משתלם בעיקר למי שבונה מודל ייעודי ורוצה שליטה מלאה על תהליך האימון.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/hubert-base-ls960")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 720 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. מותר לשנות את הקוד, לשלב אותו בתוך מוצר סגור ולהפיץ אותו, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗