GPT
M

Mistral-Small-3.1-24B-Instruct-2503

קוד פתוח

mistralaiapache-2.02025-03-11

  • vllm
  • safetensors
  • mistral3
  • mistral-common
  • en

מודל 24B עם יכולות ראייה וחלון הקשר של 128k טוקנים תחת רישיון פתוח. הוא נותן חלופה מקומית אמיתית למודלים קטנים מסחריים כמו GPT-4o Mini.

  • 24Bפרמטרים
  • 131,072טוקנים בהקשר
  • 89.5 GBמשקל הקבצים
  • 240,578הורדות בחודש

מה זה

מיסטרל לקחו את מודל ה־24B שלהם והוסיפו לו יכולת ניתוח תמונה יחד עם הקשר של 128k טוקנים. במבחני הראייה הוא עוקף את המתחרים הקרובים בקריאת מסמכים ותרשימים, עם 94.08% ב־DocVQA ו־86.24% ב־ChartQA, מה שאומר שהוא מתמודד מצוין עם סריקות, קבלות וגרפים מורכבים ולא רק עם תמונות כלליות.

בגזרת הטקסט והתכנות הוא מחזיק 88.41% ב־HumanEval ו־45.96% ב־GPQA Diamond, תוצאות שמשוות אותו ישירות למודלים כמו Claude 3.5 Haiku. הוא יודע להוציא JSON מסודר, תומך בהפעלת פונקציות מובנית, ומיועד לשמש סוכן אוטונומי שמחזיר תשובות מהירות בלי שתצטרכו לשלוח מידע החוצה לספק ענן.

מתאים ל

  • ניתוח מסמכים וטבלאות

    התוצאה הגבוהה ב־DocVQA הופכת אותו למעולה לחילוץ נתונים מדוחות סרוקים, קבלות וגרפים.

  • סוכני קריאת פונקציות

    תמיכה מובנית ב־JSON וב־Function Calling דרך vLLM לעבודה עם כלים חיצוניים.

  • הסקה מקומית מאובטחת

    מתאים לחברות שלא יכולות להוציא קבצים לענן ומחזיקות שרת מקומי עם שני כרטיסי מסך.

איפה זה נופל

ההתאמה לספריית Transformers לא נבדקה לעומק על ידי היוצרים ומבוססת בעיקר על בדיקות שפיות בסיסיות, כך שחובה להשתמש ב־vLLM כדי להימנע מבאגים מוזרים בהסקה.

בנוסף, למרות ההקשר הארוך, הביצועים שלו במבחן RULER ב־128k יורדים ל־81.20% לעומת 91.90% של Haiku, ובמבחן SimpleQA הוא עומד על 10.43% בלבד. עברית גם לא נמצאת ברשימת השפות הרשמית שלו, שמכילה ערבית, פרסית ושפות אירופאיות ואסיאתיות, ולכן חובה לבדוק אותו היטב על טקסט מקומי לפני שמשלבים אותו במערכת.

שאלות
נפוצות

אפשר להריץ אותו דרך Hugging Face Transformers הרגיל?

המשקלים קיימים אבל מיסטרל מצהירים שהם לא בדקו את התמיכה ב־Transformers מעבר לבדיקה בסיסית. ההמלצה החד-משמעית שלהם לייצור היא להשתמש ב־vLLM כדי לא להיתקל בהתנהגות לא צפויה של הטוקנייזר והמודל.

הוא מתאים לעבודה עם פרומפטים ארוכים מאוד של 128k?

הוא תומך בזה, אבל במבחני RULER ל־128k הדיוק שלו צונח ל־81.20% לעומת כמעט 94% בחלון של 32k. אם המשימה שלכם דורשת שליפת עובדות ספציפיות מקצה ההקשר, קחו בחשבון שהוא מאבד דיוק באורכים האלה.

איך מריצים

הרצה במשקל מלא של bfloat16 דורשת סביב 55 גיגה-בייט של זיכרון גרפי, מה שמחייב שני כרטיסי RTX 3090 או 4090 עם חלוקת עומס דרך vLLM. אם אתם מכווצים אותו בקוונטיזציה, הוא כבר יכול לשבת על כרטיס בודד של 24 גיגה או על מקבוק עם 32 גיגה זיכרון.

מיסטרל ממליצים במפורש להשתמש בספריית vLLM מגרסה 0.8.1 ומעלה יחד עם ספריית mistral-common, ולהגדיר טמפרטורה נמוכה של 0.15. אם אין לכם את החומרה הזו זמינה או שאין לכם צורך מובהק בפרטיות המידע, עדיף להשתמש ב־API של שירות מנוהל במקום להחזיק שרת יקר באוויר.

pip install -U huggingface_hub
hf download mistralai/Mistral-Small-3.1-24B-Instruct-2503

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש במודל למוצרים מסחריים, לשנות אותו, להפיץ אותו ולהריץ אותו איפה שרוצים, בלי לשלם תמלוגים ובלי מגבלות על קוד סגור, כל עוד שומרים על הודעת הרישיון והיוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗