GPT
V

Voxtral-Mini-4B-Realtime-2602

קוד פתוח

mistralaiapache-2.02026-01-21

  • vllm
  • safetensors
  • voxtral_realtime
  • mistral-common
  • automatic-speech-recognition

תמלול חי בסטרימינג שמגיע לדיוק של מערכות אופליין בעיכוב של חצי שנייה בלבד. פתרון קוד פתוח אמיתי למי שחייב לתרגם דיבור לטקסט בזמן אמת בלי לשלוח שמע לשרתים של צד שלישי.

  • 4.4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.5 GBמשקל הקבצים
  • 2,308,239הורדות בחודש

מה זה

במקום לתמלל קובץ שמע שלם רק אחרי שההקלטה הסתיימה, הארכיטקטורה הזו בנויה מראש להזרמה רציפה. היא משלבת מקודד שמע של כמעט מיליארד פרמטרים עם מודל שפה של 3.4 מיליארד פרמטרים, שניהם עם מנגנון קשב שמאפשר הזנה מתמשכת של שמע בלי לאבד את ההקשר הקודם.

היתרון הגדול נמצא בשליטה על העיכוב. אפשר לקנפג את זמן התגובה מ־80 מילישניות ועד 2.4 שניות דרך קובץ ההגדרות. במבחני הדיוק ב־Fleurs, עיכוב מומלץ של 480 מילישניות מניב שיעור שגיאות ממוצע של 8.72 אחוזים, שזה קרוב מאוד ל־5.90 אחוזים של מודל האופליין המקביל, אבל עם קבלת מילים בזמן אמת.

מתאים ל

  • כתוביות חיות לשידורים

    עיכוב נמוך של 480 מילישניות מאפשר הצגת טקסט כמעט מסונכרן עם הדובר באנגלית או צרפתית.

  • עוזרים קוליים אינטראקטיביים

    הזרמת טוקנים ישירה דרך vLLM מאפשרת למערכת להתחיל לעבד את התשובה עוד לפני שהמשתמש סיים את המשפט.

  • סיכום פגישות מקומי ומאובטח

    הקלטת שמע ישירות על שרת פרטי של הארגון בלי להוציא הקלטות רגישות לעננים ציבוריים.

איפה זה נופל

הנקודה הקריטית ביותר לקורא הישראלי: עברית פשוט לא קיימת ברשימת השפות הנתמכות. המודל מתמקד באנגלית, ספרדית, צרפתית, גרמנית, רוסית, סינית, יפנית, איטלקית ועוד כמה בודדות. אם תנסו להזין לו שמע בעברית תקבלו ג'יבריש מוחלט. בנוסף, אם תורידו את העיכוב לרמות הנמוכות של 160 מילישניות, שיעור השגיאות יקפוץ לכ־12.6 אחוזים, ובשפות כמו ערבית הוא מזנק ליותר מ־24 אחוזי שגיאה. לשימושים שבהם חובה דיוק קיצוני באודיו רועש או בשפות מחוץ לרשימה, הוא לא הפתרון.

שאלות
נפוצות

האם המודל יודע לתמלל שיחות בעברית?

לא. המודל אומן ותומך ברשימה ספציפית של 13 שפות בלבד, ביניהן אנגלית, ערבית, רוסית, גרמנית וצרפתית. עברית אינה נתמכת כלל, ולא מומלץ להשתמש בו עבור אודיו מקומי.

כמה חומרה באמת צריך כדי להרים אותו?

מספיק כרטיס GPU בודד עם 16GB זיכרון גרפי, מאחר שמשקל הקבצים עומד על 16.5 גיגה-בייט בפורמט המקורי. כדי לשמור על קצב תמלול רציף ויציב מומלץ להריץ אותו עם vLLM ומנוע ה־Realtime שלו.

איך משנים את רמת העיכוב בתמלול?

ערך העיכוב מוגדר בקובץ tekken.json תחת הפרמטר transcription_delay_ms. אפשר לבחור מכפלות של 80 מילישניות בין 80 ל־1200, או לקפוץ ישירות ל־2400 מילישניות, כשההמלצה היציבה ביותר של המפתחים היא 480 מילישניות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך יחיד עם לפחות 16GB זיכרון בפורמט BF16. הדרך המרכזית והמוכחת לפריסה היא דרך vLLM באמצעות פרוטוקול Realtime שמבוסס על WebSockets, מה שמתאים בדיוק להזרמת אודיו ישירה מהדפדפן או מהמיקרופון. ברירת המחדל של אורך ההקשר מקצה מקום לתמלול רציף של מעל שלוש שעות, אבל אפשר להקטין את הערך כדי לחסוך בזיכרון VRAM אם מדובר בשיחות קצרות יותר.

יש תמיכה שנוספה ל־Transformers מגרסה 5.2 ומעלה, לצד ניסיונות ראשוניים להריץ אותו מקומית על לפטופים דרך ExecuTorch, אבל הכלים האלה עדיין מוגדרים לא בדוקים לחלוטין. אם אין לכם שרת ייעודי עם GPU מתאים שזמין 24/7, עדיף להשתמש ב־API מנוהל במקום להחזיק תשתית כבדה רק בשביל שיחות מזדמנות.

pip install -U huggingface_hub
hf download mistralai/Voxtral-Mini-4B-Realtime-2602

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים פנימיים או למכור שירותים שרצים עליו, כל עוד שומרים על הודעת זכויות היוצרים המקורית ותנאי הרישיון ללא הפרת זכויות של צד שלישי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗