GPT
M

Magistral-Small-2507

קוד פתוח

mistralaiapache-2.02025-07-18

  • vllm
  • safetensors
  • mistral
  • mistral-common
  • en

זהו מודל חשיבה קומפקטי יחסית של 24 מיליארד פרמטרים שמתמקד בפתרון בעיות מורכבות. הוא נותן ביצועים חזקים במתמטיקה וקוד בלי לחייב אשכול שרתים ענק.

  • 24Bפרמטרים
  • 40,960טוקנים בהקשר
  • 87.8 GBמשקל הקבצים
  • 406הורדות בחודש

מה זה

מדובר במודל שנבנה על גבי Mistral Small 3.1 ועבר אימון ייעודי על נתיבי חשיבה ולמידת חיזוק כדי לפתח מונולוג פנימי לפני מענה. הוא עוטף את שלבי ההסקה בתגיות מיוחדות, מה שמאפשר להפריד בקלות בין תהליך המחשבה לתשובה הסופית, ומציג שיפור מסוים בעיבוד מתמטי ב־LaTeX ובמניעת לולאות פליטה אינסופיות.

במבחני הביצועים הוא מגיע ל־70.52% ב־AIME24 ו־59.17% ב־Livecodebench, מספרים שמקרבים אותו מאוד לגרסת ה־Medium הגדולה יותר. עבור מודל של 24 מיליארד פרמטרים, היכולת הזו לפתור בעיות תכנות ומתמטיקה מורכבות מקומית נותנת תמורה גבוהה לכל שקל של חומרה.

מתאים ל

  • פתרון בעיות קוד מקומי

    משיג תוצאה של מעל 59% ב־Livecodebench ויכול לרוץ בסביבה סגורה בלי להוציא קוד החוצה.

  • אימות וחישוב מתמטי

    חזק מאוד במתמטיקה עם מעל 70% ב־AIME24 ושימוש מובנה בעיצוב נוסחאות ב־LaTeX.

  • אימון מודלים קטנים

    מאפשר לייצר שרשראות חשיבה מפורטות תחת רישיון פתוח שמתאים להרצה בכלי כוונון כמו Axolotl.

איפה זה נופל

למרות שהארכיטקטורה תומכת תיאורטית בהקשר של 128 אלף טוקנים, המפתחים מודים בפירוש שהביצועים מתחילים להידרדר מעבר ל־40 אלף וממליצים להגביל אותו לשם. בנוסף, אף שהמודל תומך בעשרות שפות, עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן יכולת ההסקה שלו בעברית מוטלת בספק ומחייבת בדיקה מקדימה לפני שמשלבים אותו במערכת מקומית.

שאלות
נפוצות

האם המודל ירוץ לי על מחשב אישי רגיל?

המשקל המקורי דורש חומרה כבדה של שני כרטיסי מסך, אבל גרסה מכווצת של 4 ביט תרוץ על כרטיס RTX 4090 בודד או מחשב מק עם 32GB זיכרון. לשימוש כזה תצטרכו להוריד קובצי GGUF ולהשתמש בתוכנות כמו llama.cpp.

איך מחלצים רק את התשובה הסופית בלי המחשבות?

המודל תוחם את כל שרשרת ההסקה בתוך תגיות ייעודיות בשם THINK. אפשר להגדיר למנוע ההרצה, כמו vLLM, לחתוך את המקטע הזה ולהחזיר למשתמש רק את המענה הנקי שנכתב אחריו.

איך מריצים

כדי להריץ את המודל בדיוק מלא של bfloat16 תצטרכו להוריד כמעט 88 גיגה-בייט של קבצים, מה שמחייב לפחות שני כרטיסי מסך חזקים. בהגדרות הרשמיות של vLLM ההמלצה היא לעבוד עם חלוקה של tensor parallel על שני מעבדים גרפיים, לצד חבילת mistral-common מגרסה 1.8.2 ומעלה.

אם יש לכם מחשב מק עם 32GB זיכרון או כרטיס RTX 4090 יחיד, תצטרכו לעבור לגרסאות מכווצות בפורמטים כמו GGUF או MLX דרך llama.cpp או LM Studio. למי שאין לו תשתית כזו פנויה או שצריך מענה מדי פעם, עדיף להשתמש ב־API ולא לשרוף שעות על הגדרת סביבה כבדה.

pip install -U huggingface_hub
hf download mistralai/Magistral-Small-2507

הרישיון

המודל משוחרר תחת רישיון apache-2.0 חופשי ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש או להפיץ אותו בתוך מוצר סגור, כל עוד שומרים על הודעת זכויות היוצרים המקורית והתנאים הסטנדרטיים של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗