GPT
D

diar_sortformer_4spk-v1

קוד פתוח

nvidiacc-by-nc-4.02024-12-09

  • nemo
  • safetensors
  • sortformer
  • speaker-diarization
  • speaker-recognition

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

פתרון הפרדת דוברים של אנבידיה שמזהה מי דיבר ומתי בהקלטה מרובת משתתפים. הוא קומפקטי, מהיר מאוד בריצה מקומית, ומיועד להקלטות של עד ארבעה אנשים.

  • 124Mפרמטרים
  • 943 MBמשקל הקבצים
  • 211,486הורדות בחודש
  • 152לייקים

מה זה

המודל מבצע הפרדת דוברים מקצה לקצה בגישה שמסדרת את הדוברים לפי סדר הדיבור שלהם בהקלטה. מתחת למכסה מנוע נמצאים 18 שכבות של FastConformer ועוד 18 שכבות טרנספורמר, שמנתחים אודיו מונו בקצב דגימה של 16 קילוהרץ ומחזירים הסתברויות לזיהוי דובר בכל מקטע של 0.08 שניות.

בבדיקות דיוק המודל מציג תוצאות טובות בהקלטות קצרות של שני דוברים, עם שגיאה של 5.85% עד 6.27% במבחני CallHome ו־CH109. ככל שמספר הדוברים עולה לארבעה או שהסביבה רועשת יותר, כמו במבחן DIHARD3 שנעשה ללא טווח סובלנות לטעויות תזמון, שיעור השגיאה קופץ לכמעט 15% או 16%. מהירות העיבוד חריגה לטובה, עם מקדם זמן אמת שמגיע עד פי אלף מאורך ההקלטה על כרטיס גרפי מתאים.

מתאים ל

  • הפרדת דוברים בראיונות

    זיהוי מדויק בין שניים לשלושה משתתפים בהקלטה איכותית עם שיעור שגיאה נמוך במיוחד.

  • פילוח פודקאסטים ערוכים

    עיבוד מהיר של שיחה שלמה עד ארבעה משתתפים לצורך חלוקת תמליל לפסקאות.

  • מחקר וניסויי אודיו פנימיים

    בדיקת ביצועי מודלי diarization בקוד פתוח תחת תנאי הרישיון הלא-מסחרי.

איפה זה נופל

המגבלה הקשיחה ביותר היא תקרת ארבעת הדוברים. ברגע שנכנס דובר חמישי לשיחה, רמת הדיוק צונחת. בנוסף, המודל פועל רק על הקלטות שלמות ולא מתאים לעיבוד בזמן אמת, ועבור תרחישי סטרימינג קיימת גרסה נפרדת. הנתונים שעליהם אומן מגיעים ברובם המוחלט מאנגלית, ולכן על הקלטות בעברית, בעוצמות דיבור משתנות או ברקע רועש, צפו לפספוסים משמעותיים בהפרדה.

שאלות
נפוצות

האם אפשר לתמלל איתו את השיחה?

לא. המודל רק מזהה מי מדבר ובאיזה טווח שניות, אך אינו ממיר את הדיבור לטקסט. בשביל תמלול תצטרכו להעביר את המקטעים למודל זיהוי דיבור נפרד.

האם המודל יצליח להתמודד עם שיחה מרובת משתתפים של עשרה אנשים?

לא. הארכיטקטורה מוגבלת מבנית לארבעה דוברים מקסימום בכל הקלטה. בנוכחות יותר דוברים המערכת תתבלבל ותשייך כמה אנשים לאותו מזהה.

האם אפשר להשתמש בו לשידור חי?

לא, הגרסה הזו מיועדת לעיבוד קבצים בדיעבד בלבד. לצורך ניתוח בזמן אמת יש לפנות לגרסת הסטרימינג ששוחררה בנפרד.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה יחד עם תלויות מערכת כמו ffmpeg ו־libsndfile1. הטעינה נעשית ישירות דרך פייתון מקובץ משקלים מקומי או ישירות מהרשת, וההרצה מקבלת קובצי אודיו בודדים, רשימת נתיבים או קובץ מניפסט בפורמט jsonl.

אף שהמודל עצמו קטן יחסית, הוא שומר את כל ההקלטה בזיכרון בזמן העיבוד. על כרטיס RTX A6000 עם 48 גיגה זיכרון המגבלה עומדת על כ־12 דקות להקלטה בודדת, כך שבכרטיסים צרכניים פשוטים תיתקלו במגבלת זיכרון מהר מאוד. אם אין לכם חומרה ייעודית וצריך להריץ הקלטות באורך שעה, פנייה לפתרונות מנוהלים או פיצול ידני של הקבצים יהיו הכרחיים.

pip install -U huggingface_hub
hf download nvidia/diar_sortformer_4spk-v1

הרישיון

הרישיון הוא CC-BY-NC-4.0. המשמעות פשוטה: מותר להשתמש במודל, לשנות אותו ולעשות איתו מחקר או ניסויים פנימיים, אבל אסור בשום אופן לשלב אותו במוצר מסחרי, למכור גישה אליו או להשתמש בו לייצור רווחים ישירים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗