GPT
V

voice-gender-classifier

קוד פתוח

JaesungHuhmit2024-05-13

  • transformers
  • safetensors
  • pytorch_model_hub_mixin
  • model_hub_mixin
  • gender-classification

סיווג קול לפי מגדר בתוך קובץ ששוקל פחות משישים מגהבייט. פתרון קל וממוקד שמגיע לדיוק גבוה בלי לדרוש שרתים כבדים.

  • 15Mפרמטרים
  • 59.5 MBמשקל הקבצים
  • 136,765הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל שמזהה מגדר מתוך הקלטת שמע קצרה, גבר או אישה, ומחזיר את התשובה ישירות. הבסיס שלו הוא ארכיטקטורת ECAPA-TDNN שנועדה במקור לאימות דוברים, ועליה הוסיפו שכבה ליניארית פשוטה שמתרגמת את הייצוג הקולי לשתי מחלקות בלבד. האימון נעשה על ערכת הפיתוח של VoxCeleb2.

במבחן הזיהוי על VoxCeleb1 הוא הגיע לדיוק של 98.7 אחוזים. המשמעות בפועל היא שעל הקלטות שמזכירות ראיונות או דיבור בתנאים סבירים, הוא כמעט ולא מפספס. עם 15 מיליון פרמטרים בלבד, הוא מיועד לעשות בדיוק את הפעולה הזו במהירות, בלי להעמיס מודלי ענק של עיבוד שפה או תמלול כולל.

מתאים ל

  • סינון ראשוני במוקדי שירות

    ניתוב שיחות או ניתוח נתונים בסיסי בזמן אמת, בזכות משקל נמוך שרץ ישירות על השרת המקומי.

  • תיוג מאגרי שמע גדולים

    הפרדה אוטומטית בין דוברים ודוברות בארכיוני הקלטות, עם דיוק גבוה שנבדק על דיבור מגוון.

  • עיבוד מקדים לתמלול

    זיהוי מגדר הדובר לפני שליחה למודל תמלול כבד, כדי לדייק את הפרומפט בלי לבזבז זיכרון.

איפה זה נופל

היוצר מציין במפורש שהאימון נשען כולו על VoxCeleb, מאגר שמבוסס בעיקר על סרטוני רשת וסלבריטאים, ולכן הוא לא מייצג את כלל האוכלוסייה בעולם. זה אומר שיש סכנה להטיות מובנות. לפני שמשלבים אותו במערכת אמיתית, חובה לבדוק איך הוא מגיב למבטאים לא מוכרים, שפות זרות, ילדים, או הקלטות טלפוניות עם רעשי רקע קשים.

שאלות
נפוצות

האם חייבים להשתמש בכרטיס מסך כדי לקבל ביצועים סבירים?

ממש לא. המודל שוקל פחות משישים מגהבייט וכולל רק 15 מיליון פרמטרים. כל מעבד מודרני מריץ חיזוי כזה בחלקיקי שניה בלי להרגיש מאמץ.

איך משלבים אותו בפרויקט קיים?

הקוד דורש שימוש במאגר הגיטהאב של המפתח כדי לטעון את הארכיטקטורה. משם מייבאים את המחלקה, טוענים את המשקלים ממאגר המודלים של Hugging Face, ומעבירים נתיב לקובץ שמע ישירות לפונקציית החיזוי.

איך מריצים

המשקל הכולל של הקבצים הוא 59.5 מגהבייט, כך שאפשר להריץ אותו בלי שום בעיה על מעבד רגיל בכל מחשב או שרת זול. לא צריך מעבד גרפי ייעודי כדי לקבל זמני תגובה טובים, אם כי יש תמיכה בסיסית ב־CUDA אם יש לכם כרטיס זמין. משיגים את הקוד ממאגר הגיטהאב של הפרויקט, מתקינים את התלויות ומריצים דרך פייתון ופייטורץ'.

אין פה גרסאות שונות של גודל לבחור ביניהן. אם אתם צריכים לסווג אלפי שיחות ביום או רוצים לשלב סיווג מהיר בצד הלקוח, אין שום סיבה לשלם לספק ענן חיצוני על API כשאפשר להחזיק את המודל לוקאלית כמעט בחינם.

from transformers import pipeline

pipe = pipeline("audio-classification", model="JaesungHuh/voice-gender-classifier")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 59.5 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗