GPT
M

mms-lid-126

קוד פתוח

facebookcc-by-nc-4.02023-06-13

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • audio-classification

פתרון זיהוי שפה מדגימות שמע גולמיות שמכסה 126 שפות שונות כולל עברית ויידיש. מתאים כשלב ראשון לפני ניתוב למודלי תמלול ייעודיים.

  • 966Mפרמטרים
  • 7.2 GBמשקל הקבצים
  • 111,803הורדות בחודש
  • 36לייקים

מה זה

מדובר במודל שסווג להבחין באיזו שפה מדברים מתוך קובץ שמע, כחלק מפרויקט MMS של חברת מטא. הוא בנוי על ארכיטקטורת Wav2Vec2 עם 48 שכבות וכמעט מיליארד פרמטרים, ואומן ישירות על גבי מודל הבסיס mms-1b. המטרה שלו מוגדרת וצרה, לקבל גל קול גולמי ולהחזיר התפלגות הסתברויות על פני 126 מחלקות שפה שונות, לפי קודי תקן בינלאומיים.

בניגוד למודלי זיהוי דיבור רגילים שמנסים לתמלל את המילים עצמן, המודל הזה רק מתייג את השפה המדוברת. התמיכה שלו רחבה מאוד וכוללת שפות נפוצות כמו ערבית, אנגלית, ספרדית ורוסית, לצד שפות עם פחות משאבים דיגיטליים וגם עברית. במקום להריץ מודל תמלול כבד ומרובה שפות על כל הקלט, משתמשים בו כדי לפענח קודם באיזו שפה מדובר ואז לשלוח את האודיו למסלול המתאים.

המודל דורש דגימות בקצב של 16 קילוהרץ בלבד. אין כאן מנגנון של תמלול מלא או תרגום מובנה, אלא ראש סיווג רצף בלבד שמחזיר זיהוי בודד לכל מקטע שמע שנכנס אליו.

מתאים ל

  • ניתוב שיחות במוקדים

    זיהוי שפת הלקוח בשניות הראשונות של השיחה כדי לנתב אותו לנציג או למערכת תמלול מתאימה.

  • מיון מאגרי שמע גדולים

    סידור ותיוג אוטומטי של קובצי הקלטה לפי 126 שפות שונות לצורך ארכוב או אימון מודלים.

  • קדם עיבוד לתמלול

    בחירת מודל ASR ייעודי לשפה הספציפית במקום להשתמש במודל תמלול רב לשוני כבד.

איפה זה נופל

המודל מוגבל לזיהוי שפה אחת בלבד לכל מקטע קלט. אם יש לכם הקלטה שבה הדובר מחליף בין עברית לאנגלית באמצע המשפט, המודל יחזיר רק שפה אחת לפי הסבירות הגבוהה ביותר ולא ידע לחלק את הקובץ לחלקים. כמו כן, הוא מחייב המרה מוקדמת של כל שמע לפורמט של 16 קילוהרץ, כך שאי אפשר לזרוק אליו קבצים בפורמטים מגוונים בלי עיבוד מקדים בצינור הנתונים.

שאלות
נפוצות

האם המודל יודע לתמלל את מה שנאמר בעברית?

לא, הוא מזהה אך ורק את השפה המדוברת ולא מחזיר טקסט של המילים. אם תרצו לתמלל, תצטרכו להעביר את האודיו למודל דיבור אחר אחרי שהשפה זוהתה.

האם אפשר להשתמש בו באפליקציה בתשלום ללקוחות?

לא, הרישיון הוא לא מסחרי באופן מפורש. בשביל מוצר מסחרי תצטרכו לחפש מודל אחר ברישיון פתוח כמו אפאצ'י או MIT.

איך מריצים

כדי להריץ אותו צריך ספריית transformers בגרסה 4.30 ומעלה יחד עם PyTorch וספריות לעיבוד שמע. הקבצים שוקלים 7.2 גיגהבייט בדיוק float32, כך שבשביל לטעון אותו לזיכרון ולהריץ הסקת מסקנות מהירה תצטרכו כרטיס מסך עם לפחות 8 עד 10 גיגהבייט של VRAM פנוי. אפשר להריץ אותו גם על מעבד רגיל אם השיהוי פחות קריטי, אבל זה ייקח משמעותית יותר זמן לכל דגימה.

בפועל אתם מעלים קובץ, ממירים אותו לקצב דגימה של 16000 הרץ דרך מעבד השמע, ומעבירים את הטנזורים למודל כדי לקבל את הלוגיטים ולשלוף את קוד השפה. אם המטרה היא רק לבדוק שפה פעם בכמה שעות, הרמת שרת ייעודי עבור משקל כזה מיותרת ועדיף להשתמש בשרת קיים או בפתרון מנוהל.

from transformers import pipeline

pipe = pipeline("audio-classification", model="facebook/mms-lid-126")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 7.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה לצרכים מסחריים או בתוך מוצר שמניב הכנסות. השימוש מוגבל למחקר, פיתוח פנימי ובדיקות בלבד, ויש לתת קרדיט למחברים המקוריים של הפרויקט.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗