GPT
D

diarizen-wavlm-large-s80-md

קוד פתוח

BUT-FITcc-by-nc-4.02025-04-15

  • transformers
  • pytorch
  • speaker
  • speaker-diarization
  • meeting

מודל דיאריזציה מכווץ שמזהה מי דיבר ומתי, גם כשאנשים נכנסים זה לדברי זה. הוא חותך משמעותית בעלויות החישוב של WavLM Large ומיועד למחקר שלא דורש שרתים כבדים.

  • 265 MBמשקל הקבצים
  • 1,402הורדות בחודש
  • 51לייקים

מה זה

הארכיטקטורה כאן משלבת שכבות Conformer מעל WavLM Large של מיקרוסופט לצורך חלוקת דוברים ישירה מקצה לקצה. כדי לא להיחנק ממשאבים, החוקרים עשו לו גיזום מבני של שמונים אחוז. בפועל, גודל המודל צנח מ־316.6 מיליון פרמטרים ל־63.3 מיליון בלבד, וכמות פעולות החישוב לשנייה ירדה מ־17.8G ל־3.8G.

בבדיקות השוואה מול Pyannote 3.1 על מאגרי אודיו בעייתיים כמו AMI, AliMeeting או DIHARD3, המודל הציג שיעורי שגיאה נמוכים משמעותית, למשל 14 לעומת 22.4 ב־AMI, ו־12.5 לעומת 24.4 ב־AliMeeting ללא מרווח ביטחון של זמנים. ההקלטות במאגרים האלה כוללות רעשי רקע ומיקרופונים מרוחקים, מה שמראה שהוא מתמודד יפה עם תנאי שטח אמיתיים ולא רק עם הקלטות אולפן נקיות.

מתאים ל

  • ניתוח פודקאסטים במחקר

    זיהוי דוברים בהקלטות מרובות משתתפים לצורכי מחקר אקדמי, בזכות דיוק גבוה בחפיפות של עד שלושה קולות.

  • עיבוד אודיו מקומי ומוגן

    פרויקטים פנימיים שדורשים שמירה על פרטיות ההקלטות ללא שליחת מידע לשרתים חיצוניים, באמצעות מודל רזה וקל.

  • תיוג מאגרי דיבור למחקר

    ייצוא אוטומטי של קובצי RTTM לטובת בניית מאגרי מידע ובדיקת מודלים קוליים על גבי חומרה אישית בסיסית.

איפה זה נופל

הגרסה הספציפית הזו מוגבלת לתמיכה של עד שלושה דוברים שמדברים בו־זמנית. אם יש לכם שיחות מרובות משתתפים עם התפרצויות של ארבעה דוברים יחד, היוצרים עצמם מציינים שעדיף לעבור לגרסת v2 שמתמודדת טוב יותר עם חפיפות כאלה. מעבר לכך, האימון נעשה על מאגרי מידע באנגלית, סינית ועוד שפות כלליות, כך שאין שום הבטחה או בדיקה רשמית לגבי דיוק ההפרדה בשיחות בעברית.

שאלות
נפוצות

האם המודל מתאים למוצר מסחרי?

לא, הרישיון הוא CC BY-NC 4.0 והוא אוסר במפורש שימוש מסחרי. הסיבה לכך היא שהאימון נשען על סטים פומביים שמיועדים למחקר בלבד. אם אתם צריכים פתרון למוצר שנמכר ללקוחות, תצטרכו לאמן מודל משלכם או להשתמש במודלים עם רישיון פתוח לחלוטין.

מה ההבדל בינו לבין גרסת v2?

הגרסה הזו עברה אופטימיזציה למצבים שבהם יש עד שלושה דוברים חופפים בו־זמנית. גרסת v2 מיועדת ספציפית לתרחישים עמוסים יותר עם חפיפה של עד ארבעה דוברים, והיוצרים ממליצים לבחור בה אם החומר שלכם כולל ויכוחים סוערים או שיחות מרובות משתתפים.

כמה כוח מחשוב נדרש כדי להריץ אותו?

מעט מאוד ביחס למודלים מבוססי WavLM Large. הודות לגיזום של שמונים אחוז מהפרמטרים, המודל שוקל 265 מגה־בייט וצורך 3.8G פעולות חישוב לשנייה, כך שניתן להריץ אותו בנוחות גם על מחשב נייד עם מעבד גרפי פשוט.

איך מריצים

טעינת המודל מתבצעת בעזרת DiariZenPipeline מתוך ספריית diarizen, והוא מקבל קובץ אודיו ומחזיר ישירות זמני התחלה, סיום ותוויות דובר, עם אפשרות מובנית לייצא קובץ RTTM. הקבצים עצמם שוקלים 265 מגה־בייט בלבד, כך שלא צריך כרטיס גרפי מפלצתי כדי להריץ אותם מקומית, וגם מחשב פיתוח רגיל עם GPU צנוע יעשה את העבודה בקלות.

אם תרצו לחסוך תחזוקת תשתית ופשוט לקבל תמלול עם דוברים, יש שירותי ענן מסחריים שסוגרים את הפינה בקריאת API. הרצה עצמית פה משתלמת כשחשוב לכם לעבד קבצים בלי להוציא מידע החוצה, או כשאתם בודקים ביצועים על מאגרי נתונים אקדמיים שאי אפשר להעלות לצד שלישי.

from transformers import pipeline

pipe = pipeline("voice-activity-detection", model="BUT-FIT/diarizen-wavlm-large-s80-md")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 265 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

משקלי המודל משוחררים תחת רישיון CC BY-NC 4.0, מה שאוסר כל שימוש מסחרי, בין אם במוצר בתשלום, כחלק משירות לחברות או בתוך אפליקציה שמניבה רווח. קוד המקור עצמו אמנם מוגן ברישיון MIT, אבל בגלל שחלק ממאגרי האימון הוגבלו למחקר בלבד, אי אפשר לשלב את המשקלים האלה במוצר מסחרי בלי להפר את תנאי השימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗