GPT
M

Mistral-Small-4-119B-2603

קוד פתוח

mistralaiapache-2.02026-01-23

  • safetensors
  • mistral3
  • vLLM
  • en
  • fr

המודל הזה משלב יכולות ראייה, קוד וחשיבה מעמיקה בתוך ארכיטקטורת תערובת מומחים. הוא מאפשר לעבור בין תגובה רגילה למצב חשיבה מורכב לפי קריאה, ברישיון קוד פתוח מלא.

  • 119Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 225 GBמשקל הקבצים
  • 56,192הורדות בחודש

מה זה

מדובר במודל שמכיל 119 מיליארד פרמטרים, אבל בנוי מתערובת של 128 מומחים שמתוכם רק 4 פעילים בכל רגע. בפועל זה אומר שרק 6.5 מיליארד פרמטרים רצים עבור כל טוקן, כך שמקבלים ביצועים של מודל ענק עם זמני תגובה קצרים בהרבה. המודל מקבל קלט של טקסט ותמונות, מוציא טקסט, ומאחד את סדרות ההוראות, הקוד והחשיבה של מיסטרל לתוך נקודת קצה אחת.

השליטה במודל נעשית דרך פרמטר ייעודי פר בקשה. אפשר לבטל את מנגנון החשיבה כדי לקבל תשובות מהירות למשימות יומיומיות, או להפעיל אותו בעוצמה גבוהה כדי לפתור בעיות תכנות ומתמטיקה מורכבות. במבחני ביצועים כמו LiveCodeBench ו־AA LCR, המודל הגיע לתוצאות דומות או עדיפות מול GPT-OSS 120B וסדרת Qwen, תוך שהוא מייצר פלט קצר ב־20% עד פי ארבעה, מה שחוסך ישירות בעלויות חישוב ובזמן ההמתנה לתשובה.

מתאים ל

  • סוכן תכנות אוטונומי

    מצב החשיבה מציג תוצאות גבוהות ב־LiveCodeBench ופלט קצר שחוסך זמן בריצת סוכני קוד.

  • ניתוח מסמכים ותמונות

    המודל מקבל קלט חזותי יחד עם טקסט, מתאים לחילוץ נתונים מתמונות ומסמכים מורכבים.

  • קריאות לפונקציות ו־JSON

    תמיכה טבעית בהפעלת כלים חיצוניים וקבלת פלט מובנה לבניית צ'אטים ומערכות אוטומציה.

איפה זה נופל

למרות חלון מטא-נתונים שמציג מעל מיליון טוקנים, תיעוד המודל מגדיר בפועל תמיכה באורך הקשר של 256 אלף טוקנים בלבד, כך שלא כדאי לבנות על קלטים ארוכים מזה ללא בדיקה. בנוסף, אף שהמודל תומך במספר שפות כמו אנגלית, צרפתית, ערבית והולנדית, עברית כלל אינה מופיעה ברשימת השפות הנתמכות בכרטיס. אם המערכת שלכם מיועדת לעבד טקסטים או מסמכים בעברית, חובה לבדוק ידנית את איכות הפלט וההבנה שלו לפני שילוב בתהליכי עבודה.

שאלות
נפוצות

האם המודל ירוץ על מחשב פיתוח רגיל?

לא. גודל הקבצים מגיע ל־225 גיגה-בייט והוא דורש זיכרון וידאו עצום של מספר כרטיסים גרפיים מקצועיים. לשימוש מקומי במחשב רגיל צריך לפנות לגרסאות מכווצות ב־4 ביט או להשתמש ב־API.

איך משפיע מצב החשיבה על מהירות התשובה?

כאשר מכבים את החשיבה המודל מגיב מהר כמו מודל 24B סטנדרטי. הפעלת החשיבה במצב גבוה מאריכה את זמן העיבוד לצורך פתרון בעיות עמוקות, אך עדיין מייצרת פלט תמציתי יותר ממתחריו.

איך מריצים

כדי להריץ 225 גיגה-בייט של משקלים מקומיים תצטרכו שרת עם מספר כרטיסי מסך חזקים. מיסטרל ממליצים על vLLM עם חלוקה של לפחות שני מעבדים גרפיים במקביל כדי להחזיק את המודל בזיכרון, יחד עם חבילת mistral-common מגרסה 1.11.0 ומעלה. אם אין לכם חומרת שרתים ייעודית בעשרות אלפי שקלים, עדיף להשתמש בגרסת המשקלים המכווצת ל־4 ביט, בהאצת פענוח באמצעות ראש eagle, או פשוט לגשת דרך ה־API של החברה.

קיימת תמיכה גם בספריות כמו SGLang, transformers ישירות מגיטהאב, LM Studio ו־llama.cpp דרך קובצי GGUF של קהילת Unsloth. אם אתם מתכננים אימון והתאמה אישית, יש תמיכה מובנית דרך Axolotl.

pip install -U huggingface_hub
hf download mistralai/Mistral-Small-4-119B-2603

הרישיון

המודל מופץ תחת רישיון קוד פתוח מסוג Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פרטיים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים של המקור. המגבלה המוצהרת היחידה היא איסור על שימוש שמפר או פוגע בזכויות של צדדים שלישיים, כולל קניין רוחני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗