GPT
S

speecht5_asr

קוד פתוח

microsoftmit2023-02-02

  • transformers
  • pytorch
  • speecht5
  • automatic-speech-recognition
  • audio

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

פתרון תמלול דיבור קל משקל שרץ מקומית בלי לבלוע משאבים. הוא מתאים למי שרוצה להמיר קובצי אודיו באנגלית לטקסט ישירות בקוד שלו.

  • 578 MBמשקל הקבצים
  • 97,195הורדות בחודש
  • 44לייקים

מה זה

מדובר במודל זיהוי דיבור של מיקרוסופט שעבר כוונון ייעודי על מאגר LibriSpeech, וממיר קובצי קול בפורמט מונו של 16 קילוהרץ לטקסט כתוב. הבסיס שלו נשען על ארכיטקטורת SpeechT5, שמיישמת גישת קידוד ופענוח משותפת לטקסט וקול, בהשראת רשתות T5 מעולם עיבוד השפה הטבעית.

המבנה הזה משלב רשתות ייעודיות לכל סוג מדיה עם ליבה מרכזית של מקודד ומפענח. במהלך האימון המקדים נעשה שימוש בכימות וקטורי שחוצה בין המודלים השונים, כדי להביא ייצוגי דיבור וטקסט לאותו מרחב סמנטי. בפועל, החבילה שוקלת 578 מגה בייט בלבד, מה שהופך אותה לפתרון קומפקטי ביחס למודלים מודרניים רבים, אך כזה שמוגבל למשימת התמלול הספציפית הזו.

כרטיס המודל לא מציג תוצאות מדידה מפורטות או ציוני דיוק רשמיים, אלא נכתב על ידי צוות הגינג פייס ולא ישירות על ידי החוקרים המקוריים. לכן צריך לבחון אותו ישירות מול קובצי שמע מהעולם האמיתי כדי להבין את רמת הדיוק שלו בשטח.

מתאים ל

  • תמלול הקלטות קול באנגלית

    הוא מותאם ישירות לאנגלית נקייה ורץ מקומית בלי תלות בחיבור רשת או עלויות שימוש חיצוניות.

  • מערכות משובצות ומחשבים חלשים

    הגודל שלו, 578 מגה בייט בלבד, מאפשר לו לעלות לזיכרון של מחשבים צנועים ללא כרטיס מסך ייעודי.

  • עיבוד מקדים של פקודות קוליות

    הוא מתאים להמרת קטעי דיבור קצרים של 16 קילוהרץ לטקסט עבור צינורות עיבוד המשך.

איפה זה נופל

המודל אומן על LibriSpeech, שכולל בעיקר הקראת ספרים באנגלית נקייה, ולכן הוא צפוי להתקשות מאוד עם רעשי רקע, מבטאים זרים או שיחות יומיומיות מקוטעות. כרטיס המודל נכתב על ידי הגינג פייס ולא על ידי צוות הפיתוח של מיקרוסופט, ואין בו שום פירוט לגבי שיעורי שגיאות, התמודדות עם עברית או ביצועים בתנאי רעש. בנוסף, חובה להזין אליו אודיו בתדר דגימה מדויק של 16 קילוהרץ בערוץ מונו בלבד.

שאלות
נפוצות

האם אפשר לתמלל איתו הקלטות בעברית?

לא. המודל עבר כוונון על מאגר LibriSpeech שמכיל אנגלית בלבד. אם תזינו לו הקלטות בעברית תקבלו פלט שגוי או חסר משמעות לחלוטין.

האם חייבים כרטיס מסך בשביל להריץ אותו?

לא, אפשר להסתפק במעבד רגיל. הקבצים שוקלים 578 מגה בייט בלבד, ולכן המודל עולה לזיכרון במהירות ומבצע תמלול בלי לדרוש חומרת עיבוד גרפית ייעודית.

איך מריצים

אתם מריצים אותו ישירות מתוך ספריית transformers בפייתון באמצעות SpeechT5ForSpeechToText והמעבד הייעודי שלו. המודל שוקל בסך הכול 578 מגה בייט ונשמר בדיוק של float32, כך שאין שום צורך בכרטיסי מסך יקרים של שרתים. אפשר להריץ אותו בקלות על מעבד רגיל של מחשב נייד או שרת ענן פשוט מאוד.

אם כל מה שאתם צריכים זה לתמלל אודיו פשוט באנגלית מקומית, אין סיבה לשלם על שירותי צד שלישי או לסמוך על חיבור רשת חיצוני. מצד שני, אם נדרש תמלול מקבילי בהיקפים עצומים או טיפול בשפות מורכבות, ניהול תשתית כזו בעצמכם עלול להכביד ביחס לשימוש בפתרונות מוכנים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="microsoft/speecht5_asr")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון MIT. מדובר ברישיון מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗