GPT
H

hubert-large-ls960-ft

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • hubert
  • automatic-speech-recognition

המודל ממיר דיבור באנגלית לטקסט ישירות מתוך קובצי אודיו, בלי שלבי ביניים. הוא מתאים למי שמחפש מודל מוכן להרצה מקומית בלי תלות בענן או עלויות תמלול שוטפות.

  • 2.4 GBמשקל הקבצים
  • 85,440הורדות בחודש
  • 78לייקים
  • 24שכבות

מה זה

המודל הזה נשען על ארכיטקטורת HubertForCTC עם 24 שכבות, אחרי אימון מקדים על מאגר Libri-light והתאמה סופית על 960 שעות של קריאת ספרים באנגלית מתוך Librispeech. השיטה שלו מבוססת על לימוד עצמי של מבנה השפה והצלילים בעזרת אשכולות קול מוסתרים, בדומה לאופן שבו BERT עובד על טקסט.

בניגוד לפתרונות ישנים יותר שדרשו חיבור בין מודל אקוסטי למודל שפה נפרד, כאן מקבלים רשת אחת שמקבלת גלי קול ופולטת ישירות אותיות ומילים. הוא מתחרה ישירות ב־wav2vec 2.0 ומציג תוצאות טובות ממנו על אותו סט נתונים, במיוחד כשההקלטות ברורות. משקל הקבצים הכולל שלו עומד על 2.4 גיגה בייט, מה שמציב אותו בגודל סטנדרטי למודלים בקטגוריית ה־large.

מתאים ל

  • תמלול ספרי שמע באנגלית

    הוא אומן ישירות על הקראות ספרים, כך שעל קול בודד ואיכותי הוא ייתן תוצאות מדויקות מאוד.

  • זיהוי פקודות קוליות נקיות

    משקל של 2.4 גיגה בייט מאפשר פריסה שקטה על שרת מקומי לצורך זיהוי משפטים קצרים וברורים.

  • בסיס לאימון על שפה אחרת

    אפשר לקחת את 24 השכבות הקיימות ולאמן מחדש רק את שכבת הראש עבור תמלול ייעודי.

איפה זה נופל

הוא מוגבל אך ורק לאנגלית, כך שלעברית אין מה לחפש כאן. מעבר לכך, האימון שלו נעשה כולו על Librispeech, שזה אומר דיבור נקי של אנשים שמקריאים ספרי שמע בקול רם וברור. בשיחות חיות עם רעשי רקע, קולות קטועים או מבטאים כבדים, הדיוק יצנח משמעותית. הוא גם לא מתמודד לבד עם אותיות קטנות או סימני פיסוק, והפלט יוצא באותיות גדולות בלבד.

שאלות
נפוצות

האם אפשר להשתמש בו לתמלול שיחות בעברית?

לא. המודל אומן והותאם ספציפית לשפה האנגלית בלבד, ואין לו אוצר מילים או הבנה של צלילים בעברית. כדי לתמלל עברית תצטרכו לאמן אותו מחדש מאפס או לבחור מודל רב לשוני אחר.

מה צריך לעשות עם קובצי אודיו שלא הוקלטו ב־16kHz?

המודל נכשל לחלוטין אם מזינים לו קצב דגימה שונה מ־16 קילו הרץ. חובה לבצע המרה לקובץ לפני שמעבירים אותו לפונקציית המעבד בקוד.

איך מריצים

כדי להריץ אותו משתמשים בספריית transformers וטוענים את HubertForCTC יחד עם המעבד של Wav2Vec2. הקבצים שוקלים 2.4 גיגה בייט, כך שאפשר להריץ הסקה בלי בעיה על כרטיס מסך ביתי בסיסי עם 6 עד 8 גיגה זיכרון, ואפילו על מעבד רגיל אם השיהוי לא קריטי עבורכם.

הוא דורש שהאודיו שלכם יידגם בקצב של 16 קילו הרץ בדיוק. אם הקלט מגיע מקווי טלפון ב־8 קילו הרץ או מהקלטות באיכות אחרת, תצטרכו להמיר אותו מראש, אחרת הפלט יתקבל כג'יבריש מוחלט.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/hubert-large-ls960-ft")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר לעשות עם המודל כמעט הכל, כולל שימוש מסחרי, שינוי המשקלים ושילוב שלו במוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי של פייסבוק בעת ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗