GPT
T

turn-detector

קוד פתוח

livekitרישיון לא דווח2024-12-07

  • transformers
  • onnx
  • safetensors
  • llama
  • text-generation

הוא בודק טקסט מתומלל בזמן אמת ומנחש אם המשתמש סיים לדבר. הפתרון נועד לסוכני קול שקוטעים אנשים מוקדם מדי כשיש שתיקה קצרה.

  • 8,192טוקנים בהקשר
  • 675 MBמשקל הקבצים
  • 767,596הורדות בחודש
  • 142לייקים

מה זה

סוכני שיחה קוליים מסתמכים בדרך כלל על זיהוי שקט כדי להחליט מתי תור הבוט לענות. זה עובד רע כשמישהו עוצר לחשוב, מהסס או מקריא כתובת ארוכה. כאן נכנס מודל שפה קטן שעבר זיקוק מגרסת שבעה מיליארד פרמטרים של קוון, ומקבל את הטקסט האחרון כדי לבדוק אם המשפט הושלם מבחינה תחבירית וסמנטית.

בפועל הוא מחזיר הסתברות להופעת טוקן סיום שיחה. המספרים מראים דיוק גבוה בזיהוי סיום משפט, מעל תשעים ותשעה אחוזים ברוב השפות, אבל בזיהוי של משפט שלא הסתיים הוא מדייק באזור שמונים וחמישה עד שמונים ותשעה אחוזים בשפות מערביות. המשמעות היא שהוא עדיין יפספס מדי פעם ויקטע משתמש שמהסס באמצע משפט, אם כי הרבה פחות ממנגנון שמסתמך רק על שקט באודיו.

מתאים ל

  • איסוף נתונים קולי

    מניעת קטיעה כשהמשתמש עוצר לחשוב בזמן הקראת מספר כרטיס אשראי, כתובת מייל או מספר טלפון.

  • שיחות שירות לקוחות

    שילוב לצד זיהוי קולי כדי לאפשר ללקוחות להסס ולהשלים משפטים מורכבים בלי שהבוט יתפרץ לדבריהם.

  • בוט רב לשוני על מעבד

    הוספת הבנה סמנטית לסיום משפט בארבע עשרה שפות נתמכות, בדרישות זיכרון מינימליות של פחות מ־500MB.

איפה זה נופל

הבעיה הבולטת ביותר היא שאין עברית ברשימת ארבע עשרה השפות הנתמכות, והביצועים בשפה לא נתמכת לא מוגדרים. בנוסף, הוא עובד על טקסט בלבד ולא שומע את גוון הקול, האינטונציה או אורך ההפסקה בפועל. אם שירות התמלול שלכם טועה במילים, גם ההחלטה מתי לעצור תהיה שגויה. חלון ההקשר מוגבל למאה עשרים ושמונה טוקנים בלבד ועד שישה חילופי דברים, כך שהוא לא זוכר היסטוריה ארוכה, והוא לא מתאים למודלים קוליים ישירים כמו הרילטיים של אופן איי אם אין לכם שכבת תמלול באמצע.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחות בעברית?

המודל תומך רשמית בארבע עשרה שפות בלבד, ועברית אינה אחת מהן. בגלל שהוא מתבסס על ספי החלטה ייעודיים לכל שפה שלא קיימים עבור עברית, לא כדאי להסתמך עליו במוצר שמיועד לשוק המקומי בלי בדיקה יסודית מראש.

למה לא להשתמש פשוט במנגנון זיהוי דיבור ושתיקה רגיל?

זיהוי שתיקה מודד זמן בלבד ולא מבין תחביר. הוא קוטע אנשים שעוצרים לחשוב לרגע או אומרים מילים כמו אהה, בעוד המודל הזה קורא את הטקסט ומבין שהמשפט עדיין לא נגמר.

איך מריצים

אין שום צורך בכרטיס מסך. מריצים את גרסת האונקס המכוונת שלו על מעבד רגיל לחלוטין דרך אונקס ראנטיימ, וכל הסיפור לוקח פחות מחצי גיגה זיכרון עבודה. החומרה היחידה שחשוב להימנע ממנה היא שרתים שמשתמשים בקרדיטים של מעבד, כי ירידה פתאומית בכוח העיבוד תיצור עיכובים מעצבנים במענה.

מי שמשתמש בתשתית הענן של לייבקיט מקבל את הפיצ׳ר הזה ישירות דרכם בלי לתחזק שרת. הרצה עצמאית שווה את הזמן רק כשאתם מריצים את כל הצינור הקולי על שרתים שלכם או צריכים שליטה מלאה בזמני התגובה.

from transformers import pipeline

pipe = pipeline("text-classification", model="livekit/turn-detector")
print(pipe("שלום"))

הרישיון

הרישיון בעמוד הרשמי מוגדר כלא דווח, אך בכרטיס מצוין שהוא מופץ תחת רישיון מודל ייעודי של לייבקיט. מומלץ לקרוא את קובץ הרישיון המקורי במאגר לפני שמפיצים אותו כחלק ממוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗