GPT
T

ten-vad

קוד פתוח

TEN-frameworkרישיון לא דווח2025-05-14

  • onnx
  • Voice Acticity Detection
  • voice activity detection
  • speech activity detection
  • real time

זיהוי דיבור מקומי ומהיר שחותך שתיקות בלי שיהוקים. הוא מתאים למי שבונה סוכן קולי ורוצה זיהוי מיידי של סיום דיבור במקום להמתין מאות מילישניות.

  • 14.2 MBמשקל הקבצים
  • 285הורדות בחודש
  • 146לייקים

מה זה

מדובר במודל VAD קל במיוחד שמיועד לריצה מקומית בזמן אמת. המטרה שלו פשוטה: לקבל זרם שמע ולהחזיר בכל פריים אינדיקציה של אפס או אחת, האם יש דיבור בחדר או שקט. הוא פועל מול ספריות מוכרות כמו Silero VAD ו־WebRTC VAD, ומציג דיוק משופר בעקומות precision-recall על מערכי בדיקה ידניים כמו librispeech ו־DNS Challenge.

היתרון המעשי כאן הוא התגובה למעבר מדיבור לשקט. בעוד שסילרו נוטה לגרור שיהוי של מאות מילישניות לפני שהוא מכריז על סוף משפט, המודל הזה קוטע את המקטע כמעט מיד ומזהה גם שתיקות קצרות של חצי שנייה באמצע משפט. מבחינת משאבים, זמן הריצה שלו ביחס לשמע עומד על 0.0086 עד 0.015 במעבדי x86 מודרניים, וצריכת הזיכרון של הספרייה נשארת סביב מאות קילובייטים בודדים.

מתאים ל

  • סוכני שיחה קוליים

    זיהוי מהיר של סוף משפט כדי שהבוט יתחיל לענות מיד בלי לחכות לשתיקה ארוכה.

  • חיתוך שמע בצד לקוח

    סינון מקטעים דוממים ישירות בדפדפן דרך WASM או במכשיר נייד לפני שליחה לשרת.

  • קדם עיבוד לתמלול

    חלוקה מדויקת של הקלטות ארוכות למקטעי דיבור נפרדים כדי לייעל מודלי תמלול.

איפה זה נופל

הקלט מוגבל באופן קשיח לתדר דגימה של 16kHz בלבד. אם האודיו שלכם מגיע ב־8kHz מטלפוניה ישנה או ב־48kHz ממיקרופון איכותי, אתם חייבים לדגום אותו מחדש לפני השליחה, מה שמוסיף עיבוד בצד הלקוח. גדלי החלונות המיטביים מוגדרים ל־10 או 16 מילישניות בלבד.

מעבר לכך, סף ברירת המחדל עומד על 0.5 לקביעת דיבור, אבל המפתחים מציינים במפורש שחובה לכוונן אותו לפי רעשי הרקע שלכם. בריצת בדיקות באייפון, אין תמיכה בסימולטור או באייפד. חשוב לבדוק את ההתנהגות שלו ברעשי קהל ובמבטאים ישראליים כבדים, כיוון שמערכי הבדיקה המוצהרים נשענים על אנגלית וקיימת עדות חיצונית אחת על יפנית בלבד.

שאלות
נפוצות

האם המודל תומך בהזרמת שמע מטלפוניה רגילה?

הוא עובד רק בתדר דגימה של 16kHz. שיחות טלפון שמגיעות בדרך כלל ב־8kHz יחייבו המרת תדר בקוד שלכם לפני ההזנה למודל.

איך משלבים אותו בפרויקט קיים בלי לבנות מחדש קוד C?

אפשר להשתמש בקובץ ה־ONNX הקיים יחד עם onnxruntime בכל שפה שתומכת בו, או להתקין ישירות את חבילת הפייתון שמסופקת במאגר.

האם יש בעיה משפטית להכניס אותו למוצר סגור?

הרישיון מוגדר כ־Apache 2.0 אך כולל תנאים נוספים ורכיבי BSD. חובה לפתוח את קובץ LICENSE במאגר ולוודא שהתנאים הנוספים אינם מגבילים את אופי השימוש שלכם.

איך מריצים

המודל הזה לא דורש שום שרת GPU ייעודי. מריצים אותו ישירות על מעבדים חלשים, טלפונים ניידים או בדפדפן דרך WebAssembly, כשהוא מופץ כספרייה דינמית ב־C, קובץ ONNX או חבילת פייתון. אם אתם עובדים בפייתון, יש תמיכה בהתקנה ישירה דרך pip או הרצה מעל onnxruntime בגרסה 1.17.1 ומעלה.

ההבדל בין השיטות טמון בתלויות: הספרייה המובנית תלויה רק ב־numpy וב־libc++1, בעוד שהרצת קובץ ה־ONNX דורשת ניהול של סביבת ריצה ייעודית. אין שום היגיון לשלם על API חיצוני בשביל רכיב ששוקל מגה-בייטים בודדים ומנצל שברירי אחוז ממעבד רגיל.

pip install -U huggingface_hub
hf download TEN-framework/ten-vad

הקבצים

130 קבצים במאגר, 14.2 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון בעמוד הוגדר כלא דווח, אך המפתחים מציינים בטקסט שימוש ב־Apache 2.0 עם תנאים נוספים שלא פורטו במלואם. רכיב הערכת הגובה כולל קוד מבוסס LPCNet ברישיונות BSD. יש לעיין בקובצי הרישיון במאגר לפני שילוב בקוד מסחרי.

הרישיון המלא בעמוד המודל ↗