GPT
M

mistralai_Mistral-Small-3.1-24B-Instruct-2503-GGUF

קוד פתוח

bartowskiapache-2.02025-03-18

  • gguf
  • image-text-to-text
  • en
  • fr
  • de

גרסת GGUF מכווצת למודל של מיסטרל, שמשלבת יכולות עיבוד תמונה וטקסט בנפח של 24 מיליארד פרמטרים. היא מתאימה למי שצריך מודל ראייה מקומי שיכול להיכנס לכרטיס מסך בודד של 16 או 24 גיגה-בייט.

  • 359 GBמשקל הקבצים
  • 5,210הורדות בחודש
  • 135לייקים

מה זה

מדובר במודל רב-מודאלי שיודע לקבל תמונות לצד טקסט ולהחזיר תשובות טקסטואליות. מיסטרל הוסיפו לו יכולת ראייה באמצעות קובץ mmproj ייעודי של llama.cpp, מה שמאפשר להריץ ניתוח מסמכים או זיהוי אובייקטים מקומית. הדגש כאן הוא על גודל ביניים של 24B, שמנסה לתת חדות של מודלים ענקיים בלי לדרוש שרת עם שמונה כרטיסי מסך.

המפתח bartowski ביצע את הכיווצים בעזרת imatrix, שיטה שמצמצמת איבוד דיוק במעבר למספרים קטנים. הגרסאות כוללות אופטימיזציות למעבדי ARM ו־AVX שמשפרות זמני עיבוד פרומפטים. המודל מתמקד בשמונה שפות אירופאיות ואסייתיות ספציפיות שמוגדרות מראש.

מתאים ל

  • ניתוח תמונות ומסמכים מקומי

    מאפשר לחלץ מידע מתוך תמונות ישירות על החומרה המקומית בלי להוציא מידע רגיש לענן.

  • שרת הסקה ב־LM Studio

    גרסת Q4_K_M מתאימה בדיוק לכרטיסי 16GB ביתיים ומספקת שילוב טוב של מהירות ודיוק.

  • עיבוד על מעבדי ARM

    תומך בטעינה מחדש של משקלים בזמן ריצה בפורמט Q4_0 לשיפור ביצועי מעבד.

איפה זה נופל

הכרטיס מגדיר תמיכה רשמית בשמונה שפות בלבד, ועברית אינה אחת מהן. אל תבנו עליו לקריאת טקסט בעברית מתמונות או לניתוח שפה מקומית מורכבת בלי בדיקה מעמיקה קודם. בנוסף, גרסאות מתחת ל־4 ביט פוגעות בדיוק, וקובצי IQ לא עובדים עם מאיצי Vulkan של AMD אלא דורשים סביבת ROCm.

שאלות
נפוצות

איך מפעילים את יכולות הראייה במודל?

צריך להוריד בנפרד את קובץ ה־mmproj התואם שמצוין בפרויקט, ולטעון אותו יחד עם קובץ ה־GGUF ב־llama.cpp או ב־LM Studio. בלי הקובץ הנוסף הזה, המודל יעבד רק טקסט.

איזה קובץ כדאי להוריד מתוך הרשימה הענקית?

אם יש לכם כרטיס עם 16GB VRAM, קחו את Q4_K_M שתופס 14.33GB. אם יש לכם 24GB VRAM, לכו על Q6_K או Q5_K_M לקבלת איכות מקסימלית.

האם הוא יקרא טוב מסמכים בעברית?

המודל אומן רשמית רק על אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית, איטלקית, יפנית וקוריאנית. סביר להניח שהוא יגמגם או ייכשל לחלוטין בפענוח טקסט עברי מתמונות.

איך מריצים

כדי להריץ אותו במהירות סבירה, צריך לטעון את כל המשקלים לזיכרון ה־VRAM של כרטיס המסך. לכרטיס עם 16GB VRAM מתאימה גרסת Q4_K_M שלוקחת 14.33GB, ומשאירה מקום ל־context ולתקורה של המערכת. למי שמחזיק 24GB VRAM, גרסאות Q5_K_M או Q6_K יתנו איכות כמעט מקורית.

אפשר להריץ אותו דרך LM Studio או ישירות עם llama.cpp, כשרק צריך להוריד את קובץ ה־GGUF הספציפי ולא את כל הריפו. אם אין לכם לפחות 16GB זיכרון גרפי או שאתם צריכים זמני מענה מהירים מאוד לעומס גבוה, קריאה ל־API חיצוני תהיה זולה ופשוטה יותר מלהתעסק עם החומרה.

ollama run hf.co/bartowski/mistralai_Mistral-Small-3.1-24B-Instruct-2503-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

32 קבצים במאגר, 359 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗