GPT
M

Mistral-Small-4-119B-2603-NVFP4

קוד פתוח

mistralaiרישיון לא דווח2026-03-03

  • vLLM
  • compressed-tensors
  • en
  • fr
  • de

גרסת קוונטיזציה רשמית למודל תערובת מומחים גדול של מיסטרל, המשלב חשיבה מעמיקה, ראייה וקוד. הוא נדחס במיוחד לכרטיסי אנבידיה תומכי נקודה צפה ברמת ארבע ביט.

  • 66.0 GBמשקל הקבצים
  • 1,480הורדות בחודש
  • 118לייקים

מה זה

מיסטרל לקחו כאן שלושה קווי מודלים נפרדים שלהם ואיחדו אותם למשקל אחד: מודל שיחה רגיל, מודל הסקת מסקנות וחשיבה, ומודל פיתוח תוכנה. הארכיטקטורה מבוססת על תערובת של 128 מומחים שונים, כאשר בכל טוקן פועלים רק ארבעה מהם. מתוך 119 מיליארד פרמטרים כוללים, רק 6.5 מיליארד פעילים בכל רגע נתון, מה שמאפשר מהירות תגובה גבוהה מאוד ביחס לגודל.

המודל כולל תמיכה בקלט משולב של תמונות וטקסט, חלון הקשר עצום של 256 אלף טוקנים, ויכולת להפעיל או לכבות מצב חשיבה לפי הצורך בכל בקשה. מבחינת ביצועים מול הדור הקודם, מדובר על קיצור של 40 אחוז בזמן המענה מקצה לקצה בתצורה שמותאמת לזמני תגובה, ופי שלושה יותר בקשות בשנייה בתצורה מותאמת לעומס.

מתאים ל

  • סוכן כתיבת קוד ובדיקות

    איחוד היכולות של דבסטרל עם חלון של 256 אלף טוקנים מאפשר ניתוח תיקיות קוד שלמות והפעלת פונקציות אוטומטית.

  • ניתוח מסמכים ותמונות

    יכולת המולטימודל מאפשרת לחלץ נתונים, לקרוא גרפים ולהבין תרשימים מורכבים יחד עם קלט טקסטואלי.

  • פתרון בעיות מתמטיות וחקר

    הפעלת מצב החשיבה המובנה מקצה חישוב ייעודי לניתוח שאלות מדעיות וחישובים מורכבים לפני החזרת תשובה.

איפה זה נופל

למרות השם המטעה שכולל את המילה סמול, מדובר במודל ענק עם דרישות חומרה ספציפיות שלא יעבדו על חומרה ישנה או על כרטיסי מסך ביתיים. בנוסף, רשימת השפות הנתמכות שפורסמה אינה כוללת עברית, כך שחייבים לבדוק את איכות ההבנה והתחביר בשפה המקומית לפני שבונים עליו. הכרטיס גם מציין צורך בהגדרת פרמטרים שונה ומדויקת בין משימות חשיבה מורכבות לבין שיחה רגילה, מה שדורש ניהול ידני של הבקשות בקוד שלכם.

שאלות
נפוצות

האם המודל תומך בעברית בצורה שוטפת?

הכרטיס מפרט עשרות שפות נתמכות אך עברית אינה מופיעה ברשימה הרשמית. מומלץ לבצע בדיקות מקדימות על טקסטים בעברית כדי לבדוק שליטה בתחביר ואיכות פלט לפני שילוב במוצר.

איך מחליטים אם להפעיל את מצב החשיבה?

עבור משימות מורכבות, מתמטיקה או בעיות לוגיות מגדירים את מאפיין החשיבה לרמה גבוהה עם טמפרטורה 0.7. לשיחות רגילות או מענה מהיר מכבים אותו ומורידים את הטמפרטורה לאפס.

איך מריצים

כדי להריץ את המודל הזה צריך סביבת שרתים מבוססת אנבידיה שתומכת בקוונטיזציית NVFP4, כמו vLLM או SGLang. הקבצים שוקלים 66 גיגה בייט, ובפקודת ההרצה הרשמית מיסטרל מגדירים חלוקה בין שני מעבדים גרפיים במקביל כדי להחזיק את כל המשקולות וחלון ההקשר המלא.

אם אין לכם שני כרטיסי שרת מודרניים וחזקים שמסוגלים להריץ את סוג הדחיסה הזה, אין טעם לנסות להריץ אותו מקומית. עדיף לפנות לנקודת קצה מנוהלת דרך ממשק תכנות במקום להחזיק תשתית חומרה ייעודית כבדה כזו בארגון.

pip install -U huggingface_hub
hf download mistralai/Mistral-Small-4-119B-2603-NVFP4

הרישיון

המודל משוחרר תחת רישיון אפאצ'י 2.0, למרות שבמטא דאטה של הקובץ הרישיון לא מולא. הרישיון מאפשר שימוש מסחרי מלא, שינוי הקוד והפצה, כל עוד לא מפרים זכויות צד שלישי ומצרפים את עותק הרישיון והקרדיט המקורי למפיצים.

הרישיון המלא בעמוד המודל ↗