GPT
M

Mistral-Small-3.1-24B-Instruct-2503-GGUF

קוד פתוח

unslothapache-2.02025-03-18

  • vllm
  • gguf
  • mistral3
  • en
  • fr

גרסת קוונטיזציה של מודל 24B עם יכולות ראייה וחלון של 128k טוקנים. פתרון חזק למי שרוצה ביצועים קרובים למודלים מסחריים בלי לשלוח נתונים החוצה.

  • 131,072טוקנים בהקשר
  • 362 GBמשקל הקבצים
  • 18,406הורדות בחודש
  • 96לייקים

מה זה

מיסטראל הוסיפו בגרסה 3.1 עיבוד תמונה מובנה וחלון הקשר מלא של 128 אלף טוקנים על גבי ארכיטקטורת 24 מיליארד פרמטרים. החבילה הזו מגיעה מאנסלות' בפורמט GGUF, שנועד להרצה מקומית יעילה יותר מקבצי המקור.

במבחני ביצועים הוא עוקף מודלים כמו Gemma 3 27B ומתחרה ראש בראש עם Claude 3.5 Haiku במשימות ראייה והבנת מסמכים, עם ציון של 94.08% במבחן DocVQA. ביכולות תכנות הוא מציג 88.41% ב־HumanEval, תוצאה גבוהה ששמה אותו בליגה של מודלים סגורים מובילים.

המודל כולל תמיכה מובנית בקריאה לפונקציות ופלט JSON תקין. החוזק האמיתי שלו מול חלופות בגודל דומה הוא השילוב בין ראייה, הקשר ארוך ומבנה שמגיב היטב להנחיות מערכת קפדניות.

מתאים ל

  • ניתוח מסמכים וטבלאות

    השילוב של יכולות ראייה וציון 94% ב־DocVQA מאפשר לחלץ מידע מדויק מסריקות וגרפים.

  • סוכני קוד פנימיים

    תוצאה של 88% ב־HumanEval ותמיכה מובנית בכלים מתאימות לעבודה בתוך רשת ארגונית מבודדת.

  • קריאת טקסטים ארוכים

    חלון הקשר של 128k טוקנים מאפשר להזין תיעוד טכני שלם בלי לחתוך קטעים באמצע.

איפה זה נופל

עברית לא מופיעה ברשימת השפות הנתמכות רשמית, שכוללת ערבית ופרסית לצד שפות אירופאיות ואסייתיות. בלי בדיקה יסודית, לא הייתי בונה עליו ליישומים מורכבים בעברית.

בנוסף, במבחן RULER ב־128 אלף טוקנים הביצועים שלו יורדים ל־81.20% לעומת 91.90% בהייקו, וההטמעה דרך ספריית transformers לא נבדקה לעומק לפי המפתחים. במבחני דיוק עובדתי הוא השיג 10.43% בלבד ב־SimpleQA, נתון שמחייב זהירות מפני הזיות.

שאלות
נפוצות

האם המודל תומך בעברית ברמה טובה?

עברית אינה מוגדרת ברשימת השפות של המודל. הוא כולל תמיכה בשפות מזרח תיכוניות כמו ערבית ופרסית, אך לפני שימוש במוצר ישראלי חובה לבדוק איכות פלט, אוצר מילים ותחביר עצמאית.

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא על מחשב סטנדרטי עם 16 גיגה בייט זיכרון. צריך לפחות מקבוק עם 32 גיגה בייט זיכרון מאוחד או מחשב עם כרטיס מסך ייעודי של 24 גיגה בייט עבור הגרסאות המכווצות.

האם אני חייב להוריד את כל 362 הגיגה בייט?

ממש לא. המשקל הכולל נובע מכך שהמאגר מכיל עשרות קובצי קוונטיזציה שונים, ואתם צריכים להוריד רק קובץ GGUF בודד שמתאים לגודל הזיכרון שלכם.

איך מריצים

משקל המאגר המלא עומד על 362 גיגה בייט בגלל ריבוי גרסאות הקוונטיזציה. בגרסת המקור ב־bf16 תצטרכו בערך 55 גיגה בייט זיכרון כרטיס מסך ושני מאיצים, אבל בגרסאות מכווצות הוא נכנס לכרטיס RTX 4090 בודד עם 24 גיגה בייט או למקבוק עם 32 גיגה בייט זיכרון מאוחד.

אנסלות' ממליצים להריץ דרך vLLM עם טמפרטורה נמוכה של 0.15 והגדרת הנחיית מערכת ברורה. אם אין לכם חומרה כזו מקומית, עדיף להשתמש ב־API מנוהל מאשר להסתבך עם שרת ייעודי כבד.

ollama run hf.co/unsloth/Mistral-Small-3.1-24B-Instruct-2503-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 362 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מלא. אפשר להשתמש במודל למוצרים מסחריים, לשנות אותו, לבצע כוונון עדין ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗