GPT
S

smart-turn-v2

קוד פתוח

pipecat-aibsd-2-clause2025-07-11

  • safetensors
  • wav2vec2
  • speech-processing
  • semantic-vad
  • multilingual

זיהוי קולי סמנטי שמבין מתי אדם באמת סיים לדבר ולא רק לקח אוויר. הוא רץ ישירות על גלי הקול בלי לתמלל קודם, שוקל מעט מאוד ומגיב במילישניות.

  • 95Mפרמטרים
  • 362 MBמשקל הקבצים
  • 2,498הורדות בחודש
  • 86לייקים

מה זה

במקום להסתמך רק על שקט כמו רכיבי זיהוי דיבור ישנים, המודל הזה מנתח את גל הקול ומחזיר הסתברות יחידה: האם הדובר השלים את המשפט שלו או עצר באמצע מחשבה. הוא בנוי על שלד של wav2vec2 עם 12 שכבות וראש סיווג ליניארי פשוט, מה שמשאיר אותו בגודל של כמעט 95 מיליון פרמטרים בלבד. הוא שומע אינטונציה, מזהה מילות היסוס כמו אהה בסוף משפט, ויודע לא לחתוך את המשתמש מוקדם מדי.

בבדיקות מול דיבור אנושי מוקלט באנגלית הוא מציג דיוק של 99 אחוזים, ועל דאטה סינתטי ב־14 שפות הוא נע סביב 91 עד 96 אחוזים ברוב המקרים. ההבדל הגדול בינו לבין מודלי שפה שמנסים להבין סיום תור דרך טקסט הוא המהירות והחיסכון במשאבים, כי אין כאן תמלול ביניים שמעכב את התהליך.

מתאים ל

  • בוטים קוליים בזמן אמת

    מניעת קטיעה של הלקוח כשהוא מהסס, כדי שהבוט לא יענה באמצע משפט.

  • הפעלת מנועי הקראה

    הזרקת קול חוזר רק כשהמשתמש באמת סיים, בלי תופעה של דיבור מקביל.

  • חלוקת מקטעים במוקדים

    חיתוך מדויק של שיחות מוקד לפי סופי משפט לצורך ניתוח תוכן ודוברים.

איפה זה נופל

אם המוצר שלכם מיועד לקהל ישראלי, כאן מתחילה הבעיה. עברית לא נמצאת ברשימת 14 השפות שהוא אומן עליהן, כך שאי אפשר לסמוך עליו שיזהה אינטונציה או מילות היסוס מקומיות. נקודה נוספת היא שחלק ניכר מאימוני השפות נעשה על קולות סינתטיים של גוגל ומילות היסוס שיוצרו עם מודלי שפה, ולא על שיחות אנושיות אמיתיות. בסינית למשל הדיוק צונח ל־87.2 אחוזים, מה שמראה שהביצועים לא אחידים בכל השפות.

אותה משפחה

smart-turn יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתמלל את מה שהמשתמש אמר?

לא. הוא לא פולט טקסט אלא רק מספר בין אפס לאחד שמציין את ההסתברות שהדובר סיים לדבר, ישירות מניתוח האודיו.

האם הוא יכול לרוץ על מעבד רגיל בשרת?

כן, אבל זה לוקח כ־410 מילישניות לחתיכת אודיו של שמונה שניות. בשיחה חיה עדיף להריץ אותו על GPU כדי לקבל זמני תגובה של עשרות מילישניות בודדות.

האם הוא יעבוד טוב בשיחה בעברית?

עברית אינה חלק מ־14 השפות שנתמכות במודל. הוא עשוי לזהות שקט רגיל, אבל יפספס לגמרי מילות היסוס ודפוסי דיבור מקומיים.

איך מריצים

המודל תופס בערך 362 מגה בייט, כך שאפשר להריץ אותו בקלות על כל שרת עם כרטיס גרפי צנוע או אפילו ישירות ברמת המעבד אם התעבורה נמוכה. על כרטיס L40S של אנבידיה הוא מנתח שמונה שניות אודיו ב־12 מילישניות, ועל כרטיס T4 פשוט זה לוקח בערך 75 מילישניות.

אם אין לכם GPU זמין, מעבד 16 ליבות מריץ את אותה משימה ב־410 מילישניות. עבור שיחה קולית חיה שבה כל עיכוב מורגש, 400 מילישניות זה כבר גבולי, ולכן למענה בזמן אמת כדאי להצמיד לו מאיץ גרפי בסיסי בענן ולא לבנות על מעבד בלבד.

pip install -U huggingface_hub
hf download pipecat-ai/smart-turn-v2

הרישיון

הרישיון הוא BSD-2-Clause, רישיון קוד פתוח מתירני מאוד. אתם יכולים להשתמש בו במוצרים מסחריים, לשנות אותו ולהפיץ אותו כחלק מתוכנה קניינית, כל עוד אתם שומרים על הודעת זכויות היוצרים והפטור מאחריות המקוריים בקוד.

הרישיון המלא בעמוד המודל ↗