GPT
D

diar_streaming_sortformer_4spk-v2

קוד פתוח

nvidiacc-by-4.02025-06-04

  • nemo
  • gguf
  • speaker-diarization
  • speaker-recognition
  • speech

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל זיהוי דוברים בזמן אמת של אנבידיה שמפריד עד ארבעה קולות בשיחה. הוא שוקל מעט יחסית ומתאים למי שחייב להריץ דיאריזציה תוך כדי דיבור במקום לחכות לסוף ההקלטה.

  • 609 MBמשקל הקבצים
  • 40,589הורדות בחודש
  • 140לייקים

מה זה

הוא מבצע חלוקה של רצועת שמע לפי דוברים בשידור חי, תוך שימוש במנגנון זיכרון ששומר דגימות קול של מי שכבר דיבר לפי סדר ההופעה שלהם. הארכיטקטורה משלבת מקודד Fast-Conformer של 17 שכבות עם בלוק טרנספורמר של 18 שכבות, ומוציאה הסתברויות לכל מקטע באורך 80 מילישניות.

התוצאות במבחנים מראות פער חד בהתאם למספר המשתתפים. בשיחות של שני דוברים במבחן CALLHOME הוא שומר על שיעור שגיאה של סביב חמישה עד שבעה אחוזים, אבל ברגע שיש חמישה דוברים ומעלה השגיאה מזנקת מעבר לעשרים ואפילו ארבעים אחוזים. הוא גם מציע בחירה בין רמות השהיה שונות, מעיכוב של כמעט חצי דקה שמדייק יותר ועד תגובה מהירה של שליש שנייה שמיועדת למערכות חיות.

מתאים ל

  • סוכן קולי אינטראקטיבי

    זיהוי בזמן אמת של הדובר שמול המערכת כדי לדעת למי להגיב בהשהיה נמוכה.

  • תמלול פגישות צוות קטנות

    חלוקה אוטומטית של רפליקות בחדר של עד ארבעה משתתפים ישירות לצד מנוע תמלול.

  • הפרדת שיחות תמיכה

    מעקב מדויק אחרי נציג ולקוח בשיחת טלפון כפולה עם אחוזי שגיאה נמוכים מאוד.

איפה זה נופל

המגבלה הכי גדולה היא תקרת ארבעת הדוברים. אם יש לכם שיחת ועידה עם חמישה אנשים ומעלה, הביצועים שלו מתרסקים לחלוטין. בנוסף, האימון התבסס ברובו הגדול על אנגלית, ולכן דיוק ההפרדה בהקלטות בעברית או בסביבות רועשות מחוץ למעבדה עלול לרדת משמעותית. הוא גם עלול לאבד עקביות בהקלטות רצופות של שעות רבות.

אותה משפחה

diar-streaming-sortformer-4spk יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתמלל את המילים עצמן?

לא. המודל רק מזהה מי מדבר ומתי על ידי פליטת הסתברויות לכל חלקיק שנייה. כדי לקבל טקסט צריך לחבר אותו למודל זיהוי דיבור נפרד, כמו בדוגמה של כלי ה־C++ שמצמיד את הדוברים למילות התמלול.

מה קורה אם נכנס לשיחה אדם חמישי?

הוא לא בנוי לזה. ארכיטקטורת היציאה מוגבלת קשיחה לארבעה דוברים מקסימום, ובדיקות הביצועים מראות ששיעור השגיאות מזנק מיידית לרמות של 40 אחוז כשיש יותר מארבעה משתתפים.

איך מריצים

אפשר להריץ אותו בפייתון דרך ספריית NeMo, שדורשת התקנה של PyTorch, Cython וכלים כמו ffmpeg. לחלופין יש קובץ מכווץ בפורמט GGUF שמיועד להרצה קלה ב־C++ דרך פרויקט NeMo-Speech.cpp, שמאפשר להוסיף חותמות דובר ישירות לקובצי תמלול.

עם 117 מיליון פרמטרים ומשקל קבצים של קצת מעל 600 מגהבייט, אפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד או אפילו מקומית על מעבד בעזרת גרסת ה־GGUF. אנבידיה בדקה אותו על RTX 6000 Ada שבו הוא מציג מהירות גבוהה פי כמה מזמן אמת, כך שחומרה מפלצתית נחוצה רק אם אתם מתכננים לאמן אותו מחדש.

ollama run hf.co/nvidia/diar_streaming_sortformer_4spk-v2:Q8_0

הרישיון

הוא מופץ תחת רישיון CC-BY-4.0. המשמעות היא שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים, בתנאי שנותנים קרדיט מתאים לאנבידיה ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗