GPT
F

Frame_VAD_Multilingual_MarbleNet_v2.0

קוד פתוח

nvidiaother2025-05-08

  • nemo
  • Multilingual
  • MarbleNet
  • pytorch
  • speech

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זיהוי דיבור קל משקל שרץ על חלונות של עשרים מילישניות ומתאים לשילוב לפני תמלול או זיהוי דוברים. הוא דורש מעט מאוד משאבים ומספק הסתברות לקיום קול בכל מקטע.

  • 508 KBמשקל הקבצים
  • 2,740הורדות בחודש
  • 47לייקים

מה זה

מדובר ברשת קונבולוציה המבוססת על ארכיטקטורת MarbleNet שמיועדת לזיהוי קול אנושי באודיו (VAD). הוא מקבל קובצי אודיו מונו בקצב דגימה של 16000 הרץ ומחזיר מערך הסתברויות לכל מקטע של 20 מילישניות, בלי צורך בעיבוד מוקדם של האות. המטרה העיקרית שלו היא לשמש שלב סינון ראשוני לפני מודלים כבדים של זיהוי דיבור או חלוקת דוברים, כדי לחסוך חישובים מיותרים על שקט ורעשי רקע.

בגודל של 91.5 אלף פרמטרים ומשקל קבצים של כחצי מגה בייט, הוא זעיר בהשוואה למודלים מודרניים. האימון שלו כלל 2600 שעות של הקלטות אמיתיות, אלף שעות סינתטיות ו־330 שעות רעש טהור שנועדו למנוע זיהוי שגוי של שיעול, צחוק או נשימות. במבחני ROC-AUC הוא מגיע לציונים שנעים בין 92.27 על מערך AISHELL4 ועד 97.59 על VoxConverse-dev, מה שמראה הפרדה חזקה בין דיבור לרעש, אם כי הביצועים משתנים מעט בהתאם לסביבת ההקלטה.

מתאים ל

  • סינון מקדים לתמלול

    חיתוך שקט ורעשים מקבצי אודיו לפני שליחתם למנועי תמלול כבדים כדי לחסוך זמן חישוב.

  • הפעלה במכשירי קצה

    משקל של חצי מגה בלבד מאפשר הרצה ישירה על חומרת Jetson או מעבדים חלשים בזמן אמת.

  • הכנת מקטעים לחלוקת דוברים

    יצירת קובצי זיהוי זמנים מדויקים ברזולוציה של עשרים מילישניות לפני ניתוח זהות הדובר.

איפה זה נופל

המודל מוגבל לרזולוציה קשיחה של 20 מילישניות למקטע. אי אפשר לקבל ממנו חלוקה עדינה יותר בזמן, גם אם חותכים את האודיו למקטעים קטנים. מעבר לזה, הפלט הגולמי דורש כמעט תמיד עיבוד נוסף כמו החלקה או קביעת סף החלטה מספרי כדי למנוע קפיצות רגעיות בין דיבור לשקט.

מגבלה משמעותית נוספת היא השפות. המודל אומן ונבדק על שש שפות בלבד: אנגלית, צרפתית, גרמנית, רוסית, ספרדית וסינית. הכרטיס מציין במפורש שדיוק הזיהוי עלול לרדת בשפות או במבטאים שלא נכללו באימון. עברית לא נכללה בנתוני האימון, ולכן חובה לבדוק את שיעור השגיאות על דאטה מקומי לפני שמכניסים אותו למערכת פעילה.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על המעבד בלי כרטיס מסך?

כן. המודל שוקל 508 קילובייט בלבד ויש לו 91.5 אלף פרמטרים. ניתן לייצא אותו ל־ONNX ולהריץ אותו במהירות על מעבד רגיל דרך ONNX Runtime בלי תלות בדרייברים של אנבידיה.

האם המודל יזהה דיבור בעברית בצורה אמינה?

עברית אינה מופיעה ברשימת השפות שבהן אומן המודל, הכוללת אנגלית, צרפתית, גרמנית, רוסית, ספרדית וסינית. היצרן מציין במפורש שאיכות הזיהוי עלולה לרדת בשפות שלא נכללו בדאטה, ולכן נדרש לבצע בדיקת דיוק על הקלטות בעברית לפני השימוש.

האם הפלט של המודל מוכן לשימוש מיידי כחותמות זמן?

לא. הפלט הוא מערך הסתברויות עבור כל חלון של עשרים מילישניות. כדי להפוך אותו לחותמות זמן מוגדרות צריך ליישם סף הסתברות ידני והחלקת רעשים, או להשתמש בסקריפט הייעודי מתוך NeMo שמייצר קובצי RTTM.

איך מריצים

ההרצה נעשית דרך ספריית NeMo של אנבידיה בפייתון, והמודל עובד ישירות מול PyTorch. בגלל הגודל הזעיר שלו הוא רץ בקלות על מעבדים פשוטים, אבל תומך גם בהאצה על מאיצי אנבידיה החל מארכיטקטורת פסקל ועד בלקוול, כולל כרטיסי Jetson למכשירי קצה. אין כאן שום הצדקה טכנית לפנות לשירותי ענן או ל־API חיצוני, כי המודל כולו שוקל חצי מגה בייט וצריכת המשאבים שלו אפסית.

למי שרוצה להימנע מהתלות בספריית NeMo הכבדה בסביבת הייצור, הכרטיס כולל דוגמת קוד מלאה לייצוא לפורמט ONNX. לאחר הייצוא אפשר להריץ אותו מקומית באמצעות ONNX Runtime על המעבד בלבד בלי ספריות כבדות נוספות.

pip install -U huggingface_hub
hf download nvidia/Frame_VAD_Multilingual_MarbleNet_v2.0

הקבצים

3 קבצים במאגר, 508 KB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי במודל בהתאם לתנאי ההסכם של החברה, וחל על פריסה גלובלית. עם זאת, נדרש לפעול לפי תנאי הרישיון של אנבידיה ולוודא עמידה בהגבלות השימוש המוגדרות בו.

הרישיון המלא בעמוד המודל ↗