GPT
M

Mistral-Large-3-675B-Instruct-2512-NVFP4

קוד פתוח

mistralaiapache-2.02025-11-28

  • vllm
  • mistral-common
  • compressed-tensors
  • en
  • fr

גרסת קוונטיזציה של מודל ענק עם ארכיטקטורת מומחים וראייה ממוחשבת, שמיועדת לארגונים שרוצים יכולות קצה ברישיון פתוח על שרת ייעודי משלהם.

  • 375 GBמשקל הקבצים
  • 9,814הורדות בחודש
  • 62לייקים

מה זה

המודל משלב מודל שפה מבוסס תערובת מומחים עם 673 מיליארד פרמטרים, שמתוכם רק 39 מיליארד פעילים בכל טוקן, יחד עם אנקודר ראייה של 2.5 מיליארד פרמטרים. הוא אומן מאפס על 3,000 מעבדי H200 ומגיע עם תמיכה מובנית בחלון הקשר של 256 אלף טוקנים, מענה לפרומפטים מערכתיים, והפעלת פונקציות ישירות במבנה JSON.

גרסה זו עברה דחיסה לפורמט NVFP4 באמצעות כלי llm-compressor בשיתוף רד האט וצוות vLLM. המטרה של הדחיסה הזו היא לחסוך מקום בזיכרון ולהגיע לביצועים קרובים מאוד לגרסת FP8, תוך שמירה על יכולות שיחה ומשימות סוכנים רב לשוניות בשפות רבות, אם כי עברית לא נכללת ברשימת השפות הרשמית שלו.

מתאים ל

  • סוכני פעולה עצמאיים

    תמיכה מובנית בקריאות פונקציה ופלט JSON מסודר, שמאפשרים לחבר כלים חיצוניים בצורה אמינה.

  • ניתוח מסמכים טקסטואליים

    הקשר של עד 32 אלף טוקנים בפורמט הדחוס שומר על דיוק מלא ללא פגיעה בביצועים.

  • סייען פיתוח פנים ארגוני

    רישיון חופשי ויכולת אירוח מקומית מלאה שומרים על קוד המקור בתוך הרשת הארגונית.

איפה זה נופל

היוצרים מודים שהמודל אינו מודל חשיבה ייעודי, ומודלים שתוכננו להסקה לוגית יעקפו אותו במשימות חשיבה טהורות. בנוסף, מודלים שמתמקדים בעיבוד תמונה מובילים עליו בבירור במשימות מולטימודליות, ויש צורך לחתוך תמונות ליחס של 1:1 כדי למנוע ירידה בביצועים.

הבעיה המרכזית בגרסת ה־NVFP4 היא ירידה מורגשת בדיוק ככל שחלון ההקשר גדל. מעבר ל־64 אלף טוקנים מדווחת צניחה בביצועים לעומת משקלי ה־FP8, ובנוסף קיימת פגיעה קלה ביכולות הראייה בגלל כיול שנשען בעיקר על טקסט.

שאלות
נפוצות

האם המודל ירוץ מהר יותר על שרתי H100?

לא. על כרטיסי A100 ו־H100 מנוע vLLM מפעיל מנגנון תאימות Marlin FP4 שמעניק חיסכון בזיכרון בלבד. כדי לקבל האצה של ממש בזמן התגובה יש צורך בחומרת B200 עם תמיכה טבעית בפורמט.

איך משפיע פורמט ה־NVFP4 על פענוח תמונות?

הכיול של גרסת הקוונטיזציה נעשה ברובו על טקסט, ולכן נרשמה ירידה מסוימת בביצועים על מאגרי בדיקה ויזואליים ביחס לגרסה המקורית.

איך מריצים

כדי להריץ אותו צריך שרת בודד עם שמונה מאיצים, בדרך כלל שמונה כרטיסי A100 או H100, כאשר ארכיטקטורת Blackwell כמו B200 תיתן את המהירות המרבית בפורמט NVFP4. בכרטיסים ישנים יותר vLLM משתמשת במימוש Marlin FP4, מה שחוסך זיכרון אך לא מאיץ את זמן הריצה בהשוואה לגרסת FP8.

הרצת השרת נעשית ישירות דרך פקודת vllm serve עם חלוקת Tensor Parallel של 8. אם אתם לא מחזיקים שרתים עם מאות גיגה בייטים של VRAM ייעודי לתשתית עצמאית, העלות והתחזוקה של החומרה הזו הופכות קריאה ל־API של ספק ענן לאפשרות ההגיונית והזולה בהרבה.

pip install -U huggingface_hub
hf download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4

הקבצים

284 קבצים במאגר, 375 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפצה תחת רישיון Apache 2.0 מאפשרת שימוש חופשי לחלוטין, כולל הטמעה במוצרים מסחריים, שינוי של המשקלים ואירוח עצמי בכל סביבה. התנאי היחיד הוא שמירה על זכויות צד שלישי ומתן ייחוס, בלי תמלוגים או הגבלות שימוש נוספות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗