GPT
V

Voxtral-Small-24B-2507

קוד פתוח

mistralaiapache-2.02025-07-01

  • vllm
  • safetensors
  • voxtral
  • audio-text-to-text
  • en

מודל שפה שמקבל קול ישירות ויודע לתמלל, לסכם ולהפעיל פונקציות בלי מודל שמע נפרד באמצע. אם אתם צריכים הבנת דיבור של 30 דקות ברצף, זה כיוון ששווה לבדוק.

  • 24Bפרמטרים
  • 131,072טוקנים בהקשר
  • 90.4 GBמשקל הקבצים
  • 148,426הורדות בחודש

מה זה

במקום לחבר מודל תמלול כמו וויספר למודל שפה נפרד, המודל הזה מעבד קול ישירות ומחזיר טקסט. הוא נשען על הבסיס של Mistral Small 3 בגודל 24 מיליארד פרמטרים, ושומר על היכולות הטקסטואליות שלו יחד עם עיבוד אודיו. המשמעות היא שאפשר לשלוח הקלטה ולבקש ישירות תמצות, תשובות לשאלות או הוצאת נתונים, בלי להמיר הכל לטקסט קודם ולבזבז זמן עיבוד.

הוא כולל מצב תמלול ייעודי שמזהה שפה לבד, ותומך בהקלטות של עד חצי שעה לתמלול או 40 דקות לשיחה וניתוח. המודל מתמקד בשמונה שפות מרכזיות, ביניהן אנגלית, ספרדית, צרפתית והינדי, ויודע לקבל כמה קבצי אודיו בשיחה אחת.

מתאים ל

  • סיכום פגישות מרובות משתתפים

    מאפשר לשלוח הקלטה של עד 40 דקות ולקבל סיכום ישיר בלי תמלול ביניים, בשפות הנתמכות.

  • הפעלת פעולות מקול

    זיהוי כוונת המשתמש ישירות מההקלטה והפעלת פונקציות וממשקי API במערכת backend.

  • תמלול אודיו רציף

    כולל מצב ייעודי להמרת דיבור לטקסט עם זיהוי שפה אוטומטי להקלטות ארוכות של חצי שעה.

איפה זה נופל

החיסרון המרכזי למשתמש הישראלי הוא השפות. רשימת השפות הנתמכות כוללת שמונה שפות בלבד, ועברית אינה מופיעה בהן, כך שסביר להניח שהביצועים בהקלטות מקומיות יהיו חלשים עד לא קיימים. בנוסף, המודל לא תומך כרגע ב־system prompts, והפעלת הפונקציות מוגדרת כניסיונית, כך שאי אפשר להסתמך עליה בצורה עיוורת בפרודקשן.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

הכרטיס מפרט שמונה שפות נתמכות בלבד, ועברית אינה ביניהן. לא הייתי בונה עליו עבור פרויקטים שמבוססים על אודיו בעברית בלי בדיקה מוקדמת של התוצאות.

אפשר להריץ אותו על כרטיס מסך ביתי אחד?

לא. המודל דורש בערך 55 גיגה של זיכרון גרפי ב־bfloat16, כך שכרטיס בודד טיפוסי לא יספיק ותצטרכו חומרה עם שני מעבדים גרפיים לפחות.

איך מגדירים לו הנחיות התנהגות קבועות?

כרגע המודל אינו תומך ב־system prompts. כל ההנחיות וההוראות להתנהגות צריכות לעבור ישירות כחלק מהודעות המשתמש בשיחה.

איך מריצים

כדי להריץ אותו מקומית בפורמט bfloat16 צריך בערך 55 גיגה זיכרון גרפי, מה שאומר לפחות שני כרטיסי שרת חזקים, למשל זוג של A100 או כרטיסים מקבילים, עם חלוקה של tensor parallelism לשניים. ההרצה המומלצת היא שרת של vLLM, או שימוש ישיר בספריית Transformers החל מגרסה 4.54.0.

אם אין לכם תשתית ענן עם כרטיסים כאלה זמינים כל הזמן, העלות של החזקת שרת כזה עצמאית תהיה כבדה מאוד. במקרים שבהם נפח הפניות נמוך או לא רציף, עדיף להשתמש בנקודת קצה מנוהלת דרך API ולא להחזיק שרת ייעודי שדורש עשרות גיגה זיכרון וידאו פנוי.

pip install -U huggingface_hub
hf download mistralai/Voxtral-Small-24B-2507

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי של המשקולות ושילוב בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗