GPT
M

unsloth/Ministral-3-8B-Instruct-2512-GGUF

קוד פתוח

unslothapache-2.02025-12-02

  • vllm
  • gguf
  • mistral-common
  • mistral
  • unsloth

שילוב של מודל שפה בגודל 8.4 מיליארד פרמטרים עם מפענח תמונה של 0.4 מיליארד, שמיועד לריצה מקומית. הוא נותן חלון הקשר ענק של 256k יחד עם יכולות ראייה מובנות ותמיכה בהפעלת כלים.

  • 136 GBמשקל הקבצים
  • 11,343הורדות בחודש
  • 44לייקים

מה זה

הארכיטקטורה מחברת מודל שפה עם אנקודר ראייה ייעודי של 400 מיליון פרמטרים, מה שמאפשר לו לנתח תמונות ומסמכים ישירות בלי מודל נפרד ברקע. הוא מכוון לעבודה מובנית של סוכנים, כולל פלט JSON מסודר וקריאה לפונקציות לפי דרישה.

במדדי ההוראות, הוא עוקף את המתחרים הקרובים בקטגוריה. בבדיקת WildBench הוא הגיע לציון 66.8, מעל Qwen3 של 8 מיליארד פרמטרים, ובמדד הרב-תחומי MM MTBench השיג 8.08 נקודות לעומת 6.70 של Gemma 3 בגודל 12 מיליארד. במבחני הבנה כלליים כמו Multilingual MMLU הוא עומד על 0.706, תוצאה שמציגה דיוק תחרותי מאוד למשקל שלו.

מתאים ל

  • סוכן חכם להפעלת פונקציות

    תמיכה מובנית ב־function calling ופלט JSON יציב מאפשרים לחבר אותו ישירות למערכות תוכנה פנימיות.

  • ניתוח מסמכים ותמונות מקומי

    אנקודר הראייה המובנה קורא קבצים חזותיים ישירות על הברזל שלכם, בלי לשלוח מידע רגיש לענן.

  • עיבוד טקסטים ארוכים

    חלון הקשר של 256k טוקנים מאפשר להזין תיעוד טכני נרחב או היסטוריית שיחה ארוכה בפקודה אחת.

איפה זה נופל

הנתונים הרשמיים לא מציינים עברית ברשימת השפות הנתמכות, שכוללת שפות אירופיות, סינית, ערבית, יפנית וקוריאנית. במבחני חשיבה טהורה כמו AIME25 ו־GPQA Diamond הוא נשאר מאחורי דגמים ייעודיים כמו Qwen3-VL-8B-Thinking, כך שלא הייתי בונה עליו למתמטיקה מורכבת או כתיבת קוד מתקדם בלי בדיקה מעמיקה של הפלטים.

שאלות
נפוצות

האם המודל תומך בעברית כשפת ממשק?

הכרטיס לא מציין עברית ברשימת השפות הרשמית, שכוללת אנגלית, שפות אירופיות, ערבית ושפות ממזרח אסיה. סביר שהוא יזהה מילים בסיסיות, אבל לשימוש רציני בעברית צריך לבצע הערכה עצמאית לפני שמסתמכים עליו.

איך אפשר לצמצם את צריכת הזיכרון שלו בריצה מקומית?

חלון ההקשר המלא של 256k טוקנים תופס נפח זיכרון משמעותי מאוד. כדאי להגביל את פרמטר max-model-len בזמן ההפעלה ב־vLLM למספר נמוך יותר שמתאים לפרויקט שלכם, וכך לפנות זיכרון יקר.

איך מריצים

הגרסה המקורית בפורמט FP8 דורשת כרטיס עם 12GB זיכרון לפחות, בעוד שמשקלי ה־GGUF מכווצים ומאפשרים לרדת עוד יותר בדרישות החומרה לטובת כרטיסי מסך ביתיים או מעבדים. הדף מציין שהרצה מלאה בשרת אפשרית על מאיץ בודד כמו H200 באמצעות vLLM.

אם אתם צריכים רק שאילתות טקסט בסיסיות מדי פעם, החזקת שרת ייעודי מיותרת ועדיף לצרוך מודל מרוחק. הרצה מקומית משתלמת ברגע שמעבדים תמונות רגישות, דורשים זמן תגובה מיידי לקריאות פונקציה, או כשצריך לרוץ בסביבה מבודדת בלי גישה לרשת.

ollama run hf.co/unsloth/Ministral-3-8B-Instruct-2512-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי קוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירת הקרדיט ונוסח הרישיון המקורי, לצד איסור מפורש שהוסיפו היוצרים על הפרת זכויות קניין רוחני של צדדים שלישיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗