GPT
V

Voxtral-Mini-3B-2507

קוד פתוח

mistralaiapache-2.02025-07-01

  • mistral-common
  • safetensors
  • voxtral
  • vllm
  • en

מודל קומפקטי שמחבר תמלול שמע והבנת שפה בלי לפצל את העבודה לשני כלים שונים. הוא מקבל קול ישירות ומחזיר טקסט, תשובות או קריאות לפונקציות בלי צורך בשרשור של מנוע זיהוי דיבור נפרד.

  • 4.7Bפרמטרים
  • 131,072טוקנים בהקשר
  • 17.4 GBמשקל הקבצים
  • 473,031הורדות בחודש

מה זה

מדובר בהרחבה של Ministral 3B שמשלבת יכולות אודיו ישירות לתוך מודל השפה. במקום להעביר הקלטה דרך מודל תמלול ייעודי ואז לזרוק את הטקסט ל־LLM נפרד, הוא מעבד את גלי הקול בעצמו ומבין אותם מיד. המודל תומך בשמונה שפות מרכזיות כמו אנגלית, ספרדית, צרפתית, גרמנית והינדי, ומסוגל לזהות לבד באיזו שפה מדובר.

היתרון הגדול שלו הוא מצב עבודה כפול. אפשר להפעיל אותו כמנוע תמלול נקי עם אפס יצירתיות, או כמנוע שיחה והבנה שמסוגל לענות על שאלות לגבי ההקלטה, לסכם אותה, ואפילו להפעיל קריאות לפונקציות וממשקי API ישירות מתוך פקודות קוליות. הוא מתמודד עם הקלטות של עד 30 דקות לתמלול מלא או 40 דקות לצורכי ניתוח והבנה.

מתאים ל

  • תמלול הקלטות ארוכות

    מתאים לקבצי אודיו של עד 30 דקות באנגלית או שפות אירופיות עם זיהוי שפה אוטומטי במצב תמלול ייעודי.

  • עוזרים קוליים ואוטומציה

    הפעלת פונקציות וקריאות API ישירות מדיבור של משתמש בלי לעבור דרך שלב ביניים של טקסט.

  • סיכום ושאלות על פגישות

    עיבוד שיחות של עד 40 דקות לצורך מענה על שאלות וייצור סיכומים ישירות מהשמע.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפות. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן למעט אנגלית ושפות אירופיות או הינדי, המודל פשוט לא רלוונטי לזיהוי דיבור מקומי. מגבלה טכנית נוספת היא היעדר תמיכה בהנחיות מערכת, כך שאי אפשר להגדיר לו אישיות או חוקי התנהגות מראש כמו במודלים אחרים. בנוסף, חשוב לזכור לשנות הגדרות טמפרטורה ידנית, אפס לתמלול ו־0.2 לשיחה, אחרת איכות הפלט נפגעת.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי לתמלל שיחות בעברית?

לא. רשימת השפות הרשמית כוללת רק שמונה שפות, ביניהן אנגלית, צרפתית, גרמנית והינדי. עברית אינה נתמכת, וניסיון להזין לו שמע בעברית יוביל לטעויות קשות או לחוסר זיהוי מוחלט.

מה עדיף להגדיר לו בזמן ההרצה, תמלול או שיחה?

זה תלוי במשימה. לתמלול נקי חובה להגדיר טמפרטורה 0.0 כדי לקבל פלט מדויק בלי סטיות. אם רוצים לשאול שאלות על ההקלטה או לסכם אותה, צריך לעבור למצב שיחה עם טמפרטורה 0.2 וערך top_p של 0.95.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו בעצמי?

המודל דורש בערך 9.5 ג'יגה־בייט של זיכרון כרטיס מסך בפורמט bfloat16. כרטיס עם 12 ג'יגה־בייט יספיק להרצה בסיסית, אך לעומסים גבוהים וחלון הקשר מלא עדיף כרטיס עם 16 ג'יגה ומעלה.

איך מריצים

כדי להריץ אותו מקומית צריך מעבד גרפי עם לפחות 9.5 ג'יגה־בייט של זיכרון עבודה בפורמט bfloat16 או fp16. כרטיס ביתי פשוט עם 12 או 16 ג'יגה יחזיק אותו בקלות. הדרך המומלצת להרצה בסביבת שרת היא vLLM בגרסה 0.10.0 ומעלה יחד עם חבילת mistral-common, אבל אפשר להרים אותו גם ישירות דרך ספריית Transformers בגרסה 4.54.0 ומעלה.

אם אתם צריכים רק תמלול נקודתי של כמה קבצים ביום, אין טעם להחזיק שרת דלוק ולשלם על משאבי ענן. במקרים כאלה עדיף לפנות ל־API חיצוני. לעומת זאת, אם אתם בונים מערכת קולית אינטראקטיבית שדורשת מענה מהיר או עיבוד מקומי של הקלטות, הרצה עצמאית נותנת שליטה מלאה.

pip install -U huggingface_hub
hf download mistralai/Voxtral-Mini-3B-2507

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זה אומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים סגורים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗