GPT
M

Mistral-Small-3.2-24B-Instruct-2506-GGUF

קוד פתוח

unslothapache-2.02025-06-20

  • vllm
  • gguf
  • image-text-to-text
  • en
  • fr

גרסת קוונטיזציה של מודל מולטימודלי בינוני עם יכולות ראייה וקריאת פונקציות. הוא נותן חלון הקשר של 128K ומיועד למי שרוצה ביצועים קרובים למודלים ענקיים על חומרה מקומית.

  • 362 GBמשקל הקבצים
  • 39,656הורדות בחודש
  • 192לייקים

מה זה

מדובר בעדכון קטן לגרסה 3.1 של המודל בגודל 24B, שעבר המרה לפורמט GGUF על ידי Unsloth כדי להקל על הרצה מקומית. הוא מטפל גם בטקסט וגם בתמונות, כולל פיענוח מסמכים ותרשימים ברמה גבוהה מאוד, כפי שמעיד ציון של 94.86% במבחן DocVQA.

ההבדל המשמעותי לעומת הגרסה הקודמת מורגש ביכולת לעקוב אחרי הוראות מדויקות, שם הוא קפץ מציון של 19.56% ל־43.1% ב־Arena Hard v2, ובירידה של כמעט חצי בלולאות חזרתיות אינסופיות. במקביל, Unsloth תיקנו את תבנית השיחה והפעלת הפונקציות כדי שיעבדו כמו שצריך ב־llama.cpp.

מתאים ל

  • חילוץ מידע ממסמכים

    הוא מגיע לדיוק של 94.86% ב־DocVQA, מה שהופך אותו לבחירה מצוינת לסריקת קבלות, טפסים ודוחות מצולמים.

  • הפעלת סוכנים וכלים

    המודל כולל תיקוני תבנית מובנים להפעלת פונקציות, ומציג שיפור משמעותי במעקב אחר מבנה פקודות מורכב.

  • עיבוד תרשימים וגרפים

    עם ציון של 87.4% ב־ChartQA, הוא מתאים לניתוח מהיר של גרפים עסקיים והוצאת מסקנות ישירות מתוך התמונה.

איפה זה נופל

המודל עדיין מתקשה בעובדות יבשות, כפי שמשתקף בציון נמוך להחריד של 12.1% במבחן SimpleQA. אם המערכת שלכם צריכה לספק תשובות מדויקות בלי להמציא, אי אפשר לסמוך עליו בלי אימות חיצוני צמוד.

בנוסף, רשימת השפות הרשמית שלו כוללת שמונה שפות מערביות ומזרח אסייתיות, אך עברית אינה מופיעה בה. הוא צפוי להתקשות בניסוחים טבעיים בעברית, ולכן לא מומלץ לבנות עליו ממשק מקומי בלי בדיקה יסודית מראש.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

עברית אינה מופיעה ברשימת השפות הרשמיות של המודל, הכוללת בעיקר שפות אירופאיות, יפנית וקוריאנית. הוא עשוי להבין הנחיות פשוטות, אך איכות הפלט בעברית צפויה להיות ירודה בהשוואה לאנגלית.

באיזו תוכנה הכי כדאי להריץ אותו בפועל?

אם המטרה היא להרים שירות יציב ומהיר לחברה, המפתחים ממליצים על שרת vLLM בגרסה 0.9.1 ומעלה. לבדיקות מקומיות ופיתוח על מחשב אישי, הפקודה המוצעת ב־llama.cpp או הרצה ישירה דרך Ollama תהיה הפתרון הקל ביותר.

איך מריצים

כדי להריץ אותו בלי שרת ייעודי, הדרך הפשוטה היא דרך Ollama או פקודת llama-cli עם דגל jinja להפעלת פרומפט המערכת. המפתחים ממליצים להגדיר טמפרטורה נמוכה במיוחד של 0.15 ו־top_p של 1.00 כדי לשמור על יציבות.

בגרסת המקור הלא מכווצת נדרשים כ־55 גיגה־בייט של זיכרון כרטיס מסך, מה שמחייב שני כרטיסים חזקים בשרת vLLM. קובצי ה־GGUF המכווצים, כמו UD-Q4_K_XL, מורידים את הדרישות ומאפשרים הרצה על כרטיס בודד עם 24 גיגה־בייט זיכרון או שילוב של מעבד וזיכרון מערכת, אם כי פשרת המהירות תורגש מיד.

ollama run hf.co/unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

35 קבצים במאגר, 362 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים וציון השינויים שביצעתם בקוד ובמשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗