GPT
M

mistralai_Mistral-Small-3.2-24B-Instruct-2506-GGUF

קוד פתוח

bartowskiapache-2.02025-06-20

  • gguf
  • image-text-to-text
  • en
  • fr
  • de

גרסת קוונטיזציה מגוונת של מודל רב-מודאלי בגודל 24 מיליארד פרמטרים. היא מתאימה למי שרוצה להריץ מקומית יכולות ראייה והוראות עם תמיכה בהפעלת כלים.

  • 359 GBמשקל הקבצים
  • 16,256הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית Mistral לתבנית GGUF שביצע bartowski, תוך שימוש בכיול imatrix כדי למזער אובדן דיוק. המודל מתמודד עם משימות משולבות של תמונה וטקסט ומיועד לעבודה עם הוראות מורכבות. הוא נותן חלופה למי שצריך יותר יכולות מאשר מודלים של שבעה או שמונה מיליארד פרמטרים, אבל עדיין רוצה להימנע מהדרישות הכבדות של מודלי ענק.

העדכון המרכזי שמופיע בפרסום הוא התאמה של תבנית השיחה לתמיכה בהפעלת כלים חיצוניים דרך שרת llama.cpp, מה שמאפשר שילוב שלו במערכות אוטומציה וסוכנים. קובץ ה־JINJA שמצורף להפצה נועד בדיוק למטרה זו, ובלעדיו המודל לא יפרש נכון קריאות לפונקציות.

רשימת הקבצים מכסה קשת רחבה מאוד של דחיסות, החל ממשקל מלא בפורמט BF16 ועד לקוונטים אגרסיביים של שני ביט. החלוקה הזו מאפשרת למפתחים לבחור נקודת איזון מותאמת אישית בין מהירות, נפח זיכרון פנוי ודיוק הפלט.

מתאים ל

  • ניתוח מסמכים ותמונות

    מתאים לשרת מקומי שמעבד קבצים חזותיים באנגלית ובשפות אירופיות ללא שליחת מידע החוצה.

  • סוכן מקומי להפעלת כלים

    תבנית ה־JINJA המעודכנת מאפשרת לו לקרוא לפונקציות ולבצע אוטומציות על חומרת קצה.

  • הסקה על שרתי CPU ו־ARM

    גרסאות Q4_0 ו־IQ4_NL כוללות אופטימיזציה לסידור משקולות שמשפרת ביצועים במעבדים אלה.

איפה זה נופל

המודל תומך רשמית בשמונה שפות בלבד: אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית, איטלקית, יפנית וקוריאנית. עברית אינה מופיעה ברשימה, ולכן אי אפשר לסמוך עליו בטקסטים מקומיים בלי לבדוק ביצועים מראש. בנוסף, קריאות הכלים מחייבות שימוש בקובץ תבנית חיצוני, ואם תריצו גרסה מכווצת מדי כמו IQ2_XXS ששוקלת 6.55 גיגה-בייט, הדיוק של עיבוד התמונה וההיגיון ירד משמעותית.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד לעבודה יומיומית?

עבור רוב השימושים, קובץ Q4_K_M בגודל 14.33 גיגה-בייט נותן את האיזון הטוב ביותר בין איכות לנפח זיכרון. אם המטרה היא מהירות על מעבדי ARM או AVX, כדאי לשקול את Q4_0 שמנצל סידור זיכרון יעיל יותר. במקרה שיש כרטיס עם 24 גיגה-בייט זיכרון, אפשר לבחור ב־Q5_K_M או Q6_K.

האם המודל יפעל טוב בעברית?

התיעוד הרשמי מפרט תמיכה באנגלית, במספר שפות אירופיות, ביפנית ובקוריאנית בלבד. עברית לא נכללת ברשימת שפות היעד של המודל. הוא עשוי לייצר פלט מסוים בעברית אם נתקל בה באימון, אבל לא מומלץ להסתמך עליו למשימות ייצור בשפה זו בלי בדיקה מקיפה.

איך מריצים

כדי לעבוד עם המודל צריך כרטיס גרפי עם מספיק זיכרון, או מעבד ומספיק זיכרון RAM. גרסת ברירת המחדל המומלצת היא Q4_K_M ששוקלת 14.33 גיגה-בייט, וכדי לטעון אותה במלואה ל־GPU תצטרכו כרטיס עם לפחות 16 גיגה-בייט VRAM, שמשאיר מרווח למשקל המודל ולשכבות ההקשר. אם יש לכם כרטיס עם 24 גיגה-בייט, אפשר לעלות ל־Q5_K_M או ל־Q6_K ולקבל איכות קרובה למקור.

ההרצה מתבצעת ישירות דרך llama.cpp או LM Studio. מי שמריץ שרת מקומי צריך להוסיף את הדגל של תבנית ה־JINJA כדי לאפשר את הפעלת הכלים. במערכות ARM או מעבדים עם פקודות AVX אפשר לבחור בגרסת Q4_0 שנהנית מסידור מחדש אוטומטי של המשקולות בזמן אמת, מה שמאיץ את העיבוד בלי התעסקות ידנית בהמרות.

ollama run hf.co/bartowski/mistralai_Mistral-Small-3.2-24B-Instruct-2506-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 359 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פרטיים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗