GPT
L

lang-id-voxlingua107-ecapa

קוד פתוח

speechbrainapache-2.02022-03-02

  • speechbrain
  • audio-classification
  • embeddings
  • Language
  • Identification

זיהוי שפת דיבור מתוך קובץ שמע ללא צורך בתמלול מוקדם. הוא תומך ב־107 שפות שונות ושוקל מעט מאוד, כך שקל לשלב אותו בניתוב שיחות או בעיבוד מקדים.

  • 82.4 MBמשקל הקבצים
  • 161,123הורדות בחודש
  • 164לייקים

מה זה

הכלי מזהה שפה מדוברת מתוך קטעי קול קצרים ומחזיר את הזיהוי המתאים מתוך 107 אפשרויות, כולל עברית וערבית. הוא בנוי על ארכיטקטורת ECAPA-TDNN שלרוב משמשת לזיהוי דוברים, אך עם שכבות פנימיות נוספות שחולצות וקטורי ייצוג שמתאימים גם לאימון מודלים מותאמים אישית על דאטה פרטי.

האימון נעשה על מאגר VoxLingua107 שכולל 6,628 שעות שמע מיוטיוב, ממוצע של 62 שעות לשפה, אם כי בפועל החלוקה בין השפות אינה שוויונית כלל. במבחן על סט הפיתוח של המאגר נרשם שיעור שגיאה של 6.7 אחוזים, אך חשוב לזכור שסט הבדיקה הזה מייצג רק 33 שפות מתוך כלל הרשימה ולא את כולן.

מתאים ל

  • ניתוב שמע במוקדי שירות

    זיהוי שפת הפונה בתחילת השיחה לצורך ניתוב אוטומטי לנציג או למודל תמלול מתאים.

  • סינון וקטלוג קבצי מדיה

    מיון מהיר של מאגרי הקלטות וידאו או אודיו לפי שפת הדיבור ללא תמלול מלא.

  • חילוץ וקטורים לאימון מודל

    שימוש בשכבות הפנימיות כבסיס לחילוץ מאפיינים ובניית מזהה שפה פנימי על מידע ייעודי.

איפה זה נופל

הנתונים מבוססים על סרטוני יוטיוב שתויגו אוטומטית לפי הכותרת והתיאור, מה שמכניס רעש טבעי. היוצרים מציינים במפורש כי המודל מתקשה מול דיבור במבטא זר, דיבור של ילדים ואנשים עם לקויות דיבור, ומפגין ביצועים פחות טובים בקולות נשיים בגלל רוב גברי מובהק בנתוני המקור.

בנוסף, עבור עברית המודל מחזיר את קוד ה־ISO הישן iw במקום he, ועבור יאוונית jw במקום jv, פרט שדורש מיפוי ידני בקוד כדי למנוע באגים.

שאלות
נפוצות

איך מטפלים בקוד השפה של עברית שמוחזר מהמודל?

התווית שמקבלים היא iw ולא he בגלל תקן מיושן במאגר המקורי. הפתרון פשוט, מוסיפים שורת קוד אחת שמחליפה את המחרוזת iw ב־he ברגע קבלת התוצאה.

האם צריך GPU כדי להשתמש בו בשרת ייצור?

ממש לא. המודל קל במיוחד ודורש פחות מ־100 מגה־בייט של זיכרון, כך שמעבד רגיל יספק זמני תגובה מצוינים לרוב השימושים.

איך מריצים

המודל שוקל 82.4 מגה־בייט בלבד, מה שאומר שהוא רץ בקלות על כל מעבד פשוט ללא צורך בכרטיס מסך ייעודי. התקנת ספריית speechbrain בגרסת הפיתוח שלה מאפשרת לטעון אותו ישירות ולבצע הסקת מסקנות מקומית.

הוא מצפה לאודיו בקצב דגימה של 16kHz ובערוץ מונו יחיד. הפונקציה המובנית מבצעת המרה ודגימה מחדש בעצמה כשמעבירים לה נתיב לקובץ, אך בעבודה על אצוות של טנסורים יש לוודא שהאודיו הותאם מראש לדרישות האלו.

pip install -U huggingface_hub
hf download speechbrain/lang-id-voxlingua107-ecapa

הקבצים

9 קבצים במאגר, 82.4 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל במוצרים מסחריים מסחריים ושינוי של הקוד. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗