GPT
H

hubert-large-ll60k

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • hubert
  • feature-extraction

מודל שמע שנועד לחלץ ייצוגים אקוסטיים עמוקים מקבצי קול באנגלית. הוא בסיס מעולה לפיתוח מודלי דיבור, אבל לא פולט טקסט ישר מהקופסה.

  • 2.4 GBמשקל הקבצים
  • 153,169הורדות בחודש
  • 36לייקים
  • 24שכבות

מה זה

פייסבוק אימנה את המודל הזה על שישים אלף שעות של ספרי שמע באנגלית מתוך מאגר Libri-Light, ללא תמלול ידני. במקום לחזות מילים, הוא משתמש בשיטה של אשכולות צליל כדי ללמוד את המבנה האקוסטי והלשוני של הדיבור ישירות מהאות הגולמי.

המטרה העיקרית שלו היא חילוץ מאפיינים. הוא מכיל עשרים וארבע שכבות שמייצרות וקטורים עשירים לכל מקטע קול. לפי המאמר של המפתחים, הגישה הזו משפרת את דיוק זיהוי הדיבור בהשוואה ל־wav2vec 2.0 ומורידה את שיעור שגיאות המילים בעד תשעה עשר אחוזים במבחנים קשים, במיוחד כשיש מעט מאוד מידע מתויג לאימון.

מתאים ל

  • בסיס למערכות זיהוי דיבור

    אימון שכבת חיזוי מעל המודל לתמלול מדויק של אנגלית, גם כשיש לכם מעט שעות של הקלטות מתויגות.

  • חילוץ וקטורים לניתוח קול

    שימוש בעשרים וארבע השכבות כדי להמיר אודיו לייצוגים מתמטיים לצורכי סיווג, השוואה ומחקר אקוסטי.

  • דחיסה וייצוג שמע

    למידת יחידות דיבור בדידות לטובת משימות של דחיסת קול או יצירת דיבור ללא תלות בטקסט.

איפה זה נופל

הוא לא יודע להחזיר טקסט. אין לו טוקנייזר ואין לו שכבת פלט שממירה קול לאותיות. אם תורידו אותו עכשיו, תקבלו רק וקטורים מספריים. כדי להפוך אותו למערכת זיהוי דיבור תצטרכו להוסיף טוקנייזר ולאמן עליו שכבת סיווג עם נתונים מתויגים. בנוסף, הוא אומן על אנגלית בלבד ומחייב קלט שמע בקצב דגימה של 16 קילו־הרץ.

שאלות
נפוצות

אפשר לתמלל איתו הקלטות ישר אחרי ההורדה?

לא. המודל אומן רק להבין מאפייני שמע ולא מכיל רכיב שממיר אותם לטקסט. כדי לקבל תמלול תצטרכו לבצע עליו כוונון עדין עם טוקנייזר וטקסט מתויג באמצעות HubertForCTC.

הוא מתאים לקבצי שמע בעברית?

הוא אומן על מאגר Libri-Light שמכיל דיבור באנגלית בלבד. דפוסי הצליל והאשכולות שהוא למד מותאמים לפונטיקה הזו, ולכן הוא לא מיועד לשמע בעברית בלי אימון מחדש.

איך מריצים

המודל שוקל 2.4 גיגה־בייט ומבוסס על ספריית transformers. כדי לחלץ ממנו מאפיינים לא צריך מפלצת, אבל בשביל אימון המשך או עבודה בזמן אמת כדאי להחזיק כרטיס מסך עם לפחות 8 או 12 גיגה זיכרון גרפי.

חובה להזין לו קול שנדגם בדיוק בתדר של 16 קילו־הרץ, אחרת התוצאות ייפגעו לחלוטין. אם אתם רק צריכים לתמלל הקלטות באנגלית בלי לפתח מודל ייעודי משלכם, חבל להסתבך עם התשתית הזו ועדיף לקחת מודל שכבר כולל ראש תמלול מוכן.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/hubert-large-ll60k")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון חופשי ומתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗