GPT
M

multitalker-parakeet-streaming-0.6b-v1

קוד פתוח

nvidiaother2025-10-15

  • nemo
  • speaker-diarization
  • speech-recognition
  • multitalker-ASR
  • multispeaker-ASR

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול בזמן אמת של אנבידיה שיודע להפריד בין דוברים שמדברים בו-זמנית. הוא עושה את זה בלי צורך בהקלטת קול מוקדמת של הדוברים.

  • 2.3 GBמשקל הקבצים
  • 738הורדות בחודש
  • 132לייקים

מה זה

מדובר במודל זיהוי דיבור בגודל 600 מיליון פרמטרים שמיועד לתמלול שיחות חיות מרובות משתתפים. השוני המרכזי מול מודלים רגילים הוא היכולת שלו להתמודד עם דיבור חופף, מצב שבו אנשים נכנסים זה לדברי זה, בלי לבקש דגימת קול מקדימה כדי לזהות מי מדבר.

במקום להסתמך על וקטורי קול, המודל מקבל זיהוי זמני דיבור ממודל דיאריזציה חיצוני ומזריק את המידע ישירות לשכבות הקידוד של הרשת. הארכיטקטורה מריצה עותק נפרד של המודל עבור כל דובר שמשתתף בשיחה, וכל עותק מתמקד בתמלול של אדם אחד בלבד מתוך אותו פס קול.

במבחני ביצועים על שיחות מרובות דוברים עם חפיפה, המערכת מגיעה לשיעור שגיאות מילים של 15.81 על מאגר CH109 ועד 37.44 על AMI SDM במיקרופונים מרוחקים, שניהם בהשהיה של 1.12 שניות. במצב של דובר יחיד המודל מציג ממוצע שגיאות של 7.44 על פני מאגרי הבדיקה הסטנדרטיים באנגלית.

מתאים ל

  • תמלול פגישות וידאו חיות

    הוא מבודד כל משתתף בזמן אמת גם כשאנשים מתפרצים ומדברים יחד.

  • מוקדי שירות לקוחות

    מאפשר תמלול נפרד של נציג ולקוח ללא צורך בהקלטה מוקדמת של הקול.

  • תמלול תוכניות וראיונות

    מתמודד היטב עם שיחות דינמיות מרובות דוברים שמוקלדות ברצף.

איפה זה נופל

החיסרון המרכזי הוא התלות המוחלטת במודל דיאריזציה חיצוני. אם המודל שמזהה מי דיבר ומתי טועה בזמנים, התמלול של המודל הזה ייפגע ישירות. בנוסף, שיעור השגיאות מזנק ל־37.44 בהקלטות מחדר עם מיקרופון יחיד ומרוחק לעומת 21.26 במיקרופון אישי קרוב, כך שרעשי רקדה ומרחק פוגעים בו קשות. הנתונים בכרטיס מציגים אנגלית בלבד, ואין שום תיעוד לתמיכה בשפות אחרות או בעברית.

שאלות
נפוצות

האם המודל יודע לעבוד לבד ישירות על קובץ שמע?

לא. המודל דורש פלט ממודל דיאריזציה חיצוני כמו Streaming Sortformer שמסמן מתי כל דובר מדבר, ובלי המידע הזה הוא לא יכול להפריד בין הדוברים.

כמה זיכרון GPU דרוש כדי לתמלל שיחה של ארבעה אנשים?

הארכיטקטורה מחייבת הרצת מופע מודל מלא עבור כל דובר בנפרד. עבור ארבעה דוברים תצטרכו להחזיק בזיכרון ארבעה מופעים של מודל ה־0.6B במקביל, בתוספת מודל הדיאריזציה עצמו.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה יחד עם תלויות כמו PyTorch, Cython ו־ffmpeg. המודל שוקל 2.3 גיגה-בייט ומקבל אודיו מונו בקצב דגימה של 16 קילו-הרץ. אתם מגדירים את חלון ההשהיה הרצוי, מקפיצות קצרות של 80 מילי-שניות ועד 1.12 שניות שנותנות דיוק גבוה יותר.

הנקודה הקריטית בחומרה היא שכפול המשאבים. מכיוון שצריך להריץ מופע נפרד של המודל לכל דובר פעיל בתוספת מודל דיאריזציה כמו Streaming Sortformer, כרטיס המסך שלכם צריך להחזיק כמה מופעים במקביל. אם יש לכם שיחה מרובת משתתפים על שרת מקומי קטן, צריכת הזיכרון תכפיל את עצמה פי שלושה או ארבעה מהר מאוד.

pip install -U huggingface_hub
hf download nvidia/multitalker-parakeet-streaming-0.6b-v1

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. זה אומר שאנבידיה מחילה תנאי שימוש ייעודיים משלה על המשקולות, ואי אפשר להניח שמותר להטמיע אותו במוצר מסחרי בלי לבדוק את מסמך הרישיון המדויק שמצורף לקבצים.

הרישיון המלא בעמוד המודל ↗