GPT
D

diar_streaming_sortformer_4spk-v2.1

קוד פתוח

nvidiaother2025-10-22

  • nemo
  • speaker-diarization
  • speaker-recognition
  • speech
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

פתרון דיאריזציה בזמן אמת לזיהוי של עד ארבעה דוברים במקביל. הוא מתאים למי שבונה סוכני קול או תמלול חי וצריך לדעת מי דיבר בלי לחכות לסוף ההקלטה.

  • 469 MBמשקל הקבצים
  • 55,771הורדות בחודש
  • 104לייקים

מה זה

מדובר במודל שמחלק הקלטת אודיו למקטעים לפי זהות הדובר תוך כדי הזרמת הקול, על בסיס ארכיטקטורת FastConformer וטרנספורמר ייעודי. הרעיון המרכזי כאן הוא שמירת מטמון אקוסטי של דוברים לפי סדר הופעתם בשיחה, מה שמאפשר לו לעקוב אחרי מי מדבר בלי לערבב בין זהויות לאורך זמן.

המודל מפיק הסתברויות לכל מקטע של 80 מילישניות עבור עד ארבעה דוברים. במבחני ביצועים על מאגרי שיחות כמו CALLHOME ברמת השהיה של כשלושים שניות, גרסת הבסיס מציגה שיעור שגיאה של 6.27% לשני דוברים ו־12.30% לארבעה דוברים, אך בדיקות עם חמישה דוברים ומעלה מקפיצות את השגיאה לאזור ה־40% ומעלה.

מתאים ל

  • סוכני קול מבוססי NeMo

    זיהוי דובר חי בזמן אמת כדי שהבוט יידע מי בדיוק פנה אליו בשיחה מרובת משתתפים.

  • תמלול שיחות ופגישות קטנות

    הפרדה בין עד ארבעה משתתפים תוך כדי דיבור עם השהיה נמוכה של כשנייה אחת בלבד.

  • הכנת נתוני אימון מוקלטים

    חיתוך קובצי קול ארוכים למקטעים נקיים לפי דובר לצורך אימון מודלי דיבור אחרים.

איפה זה נופל

המגבלה הקשיחה ביותר היא תמיכה בארבעה דוברים בלבד. ברגע שנכנס דובר חמישי, שיעור השגיאות מזנק והמודל מתחיל לפספס או לייחס מילים לדוברים הלא נכונים.

אימוני המודל התבססו על כ־5,000 שעות שרובן באנגלית. עברית לא נכללה בנתוני האימון הרשמיים, מה שאומר שחובה לבדוק אותו עצמאית על שיחות בעברית לפני חיבור למערכת חיה, בייחוד בתנאי רעש או הקלטות מהטלפון שעלולות לשבש את המטמון האקוסטי.

אותה משפחה

diar-streaming-sortformer-4spk יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתמלל את הטקסט בעצמו?

לא. המודל מבצע רק דיאריזציה, כלומר מזהה מתי כל אחד דיבר ומחזיר זמני התחלה וסיום לפי אינדקס של דובר. כדי להפיק טקסט תצטרכו להעביר את המקטעים למודל תמלול נפרד.

איך משפיע המעבר להשהיה של שנייה אחת על המערכת?

הורדת זמן ההמתנה לדקה או לשנייה אחת מתבצעת על ידי הקטנת גודל החלונות והקשר העתידי בהגדרות המודל. זה מאפשר תגובה מיידית בשידור חי, אך מעלה את מקדם זמן העיבוד ל־0.093 ועלול להגדיל את שגיאות הזיהוי.

איך מריצים

ההרצה נעשית ישירות דרך ספריית NeMo של אנבידיה בתוך פייתון, ודורשת קובץ אודיו מונו בתדר דגימה של 16 קילוהרץ. תצטרכו להגדיר ידנית פרמטרים של הזרמה כמו גודל חלון וגודל תור, כאשר ניתן לבחור בין השהיית קלט נמוכה של 1.04 שניות לבין מצב השהיה של 30.4 שניות שמעניק דיוק גבוה יותר.

המשקל הכולל של הקבצים עומד על 469 מגה בייט עם 117 מיליון פרמטרים, גודל קל מאוד שרץ בלי מאמץ על כרטיסי מסך ביתיים או שרתים קטנים. המדידות של החברה מציגות עיבוד מהיר בהרבה מזמן אמת על גבי RTX 6000 Ada, כך שאין צורך ב־API חיצוני יקר אם יש לכם חומרה בסיסית.

pip install -U huggingface_hub
hf download nvidia/diar_streaming_sortformer_4spk-v2.1

הרישיון

הרישיון מוגדר תחת סיווג other ולא תחת רישיון קוד פתוח סטנדרטי דוגמת MIT או Apache. המשמעות היא שחובה לבדוק את תנאי השימוש הפרטניים שצורפו למאגר של אנבידיה כדי לדעת אם מותר לשלב אותו ישירות במוצר מסחרי או להפיץ אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗