GPT
M

Ministral-3-3B-Instruct-2512-GGUF

קוד פתוח

unslothapache-2.02025-12-02

  • vllm
  • gguf
  • mistral-common
  • mistral
  • unsloth

גרסת GGUF מכווצת למודל קל משקל שמשלב עיבוד טקסט עם ראייה ממוחשבת. הוא מיועד להרצה מקומית על חומרה צנועה מבלי לוותר על תמיכה בכלים ותמונות.

  • 57.8 GBמשקל הקבצים
  • 23,386הורדות בחודש
  • 42לייקים

מה זה

מדובר במודל שמורכב משני חלקים: מודל שפה של 3.4 מיליארד פרמטרים ומקודד ראייה של 0.4 מיליארד פרמטרים. השילוב הזה נותן לו יכולת לעבד קלט משולב של טקסט ותמונות, לצד תמיכה מובנית בחלון הקשר של 256 אלף טוקנים, פנייה לפונקציות ופלט JSON מובנה.

במבחני ביצועים מול מודלים קטנים אחרים, גרסת ה־3B עוקפת את Qwen3-VL-4B בפתרון בעיות מתמטיות של AIME25 עם ציון 0.721 לעומת 0.697, ובמבחן LiveCodeBench עם 0.548 לעומת 0.513. היא מציגה תחרות חזקה בראייה ממוחשבת במבחן MM MTBench עם תוצאה של 7.83, מעל Gemma 3 4B שקיבלה 5.23, אבל מפגרת בדירוג Arena Hard מול מודלים מקבילים.

מתאים ל

  • חילוץ מידע מתמונות

    מקודד הראייה המובנה מאפשר ניתוח מסמכים ותמונות על חומרה מקומית חלשה.

  • סוכנים אוטונומיים קלים

    תמיכה מובנית בזימון פונקציות ופלט JSON מסודר עבור רכיבי קצה.

  • מיון טקסט בזמן אמת

    מודל 3.4B מהיר שמתאים לתיוג וסיווג מקומי מבלי לשלוח מידע לרשת.

איפה זה נופל

במבחני יצירת טקסט כלליים הוא חלש יחסית. במבחן Arena Hard הוא מגיע לציון 0.305 בלבד, הרבה מאחורי Qwen3-VL-4B Instruct שעומד על 0.438. גם ב־GPQA Diamond הוא משיג רק 0.534. בנוסף, עברית כלל לא נכללת ברשימת השפות הנתמכות שסופקה בכרטיס, כך שחובה לבדוק אותו עצמאית לפני שבונים עליו לעבודה בעברית.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך צרכני פשוט?

כן. בפורמט FP8 הוא צריך פחות מ־8GB של זיכרון וידאו, ובגרסאות GGUF מכווצות הוא תופס אפילו פחות. שימו לב רק להגביל את חלון ההקשר כדי לא לפוצץ את הזיכרון.

האם אפשר להשתמש בו למערכות בעברית?

התיעוד הרשמי מציין אנגלית, צרפתית, ספרדית, גרמנית, איטלקית, פורטוגזית, הולנדית, סינית, יפנית, קוריאנית וערבית, ועברית אינה מופיעה ברשימה. מומלץ לבצע בדיקות מקדימות על טקסט עברי לפני פריסה.

איך מריצים

בפורמט FP8 המקורי המודל דורש פחות מ־8GB של זיכרון כרטיס מסך, וכאן בגרסאות GGUF המכווצות אפשר לדחוס אותו אפילו יותר כדי לרוץ על כרטיסי מסך ביתיים או ישירות על המעבד. אם מריצים דרך vLLM או Transformers, חשוב לעדכן לגרסאות חדשות ולהגדיר ידנית את אורך ההקשר, כי ברירת המחדל עומדת על 256k מלאים ויכולה לחסל את הזיכרון מיד.

אם אתם צריכים רק קריאות מזדמנות לניתוח תמונות ולא מנהלים תשתית מקומית קבועה, עדיף להשתמש ב־API חיצוני. הרצה עצמית שווה את הטרחה בעיקר למערכות קצה, מכשירים מוטמעים, או תרחישים שבהם המידע הרגיש של התמונות חייב להישאר על הברזל שלכם.

ollama run hf.co/unsloth/Ministral-3-3B-Instruct-2512-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת הרישיון המקורית ולא מפרים זכויות צד שלישי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗