GPT
M

Mistral-Medium-3.5-128B-GGUF

קוד פתוח

unslothother2026-04-27

  • gguf
  • mistral3
  • mistral
  • unsloth
  • en

גרסת GGUF למודל דחוס של 128 מיליארד פרמטרים שמיועד למשימות תכנות וחשיבה מורכבות. הוא מתאים למי שרוצה ביצועים ברמת מערכת שלמה ומחזיק חומרה מתאימה להרצה מקומית.

  • 262,144טוקנים בהקשר
  • 1.8 TBמשקל הקבצים
  • 13,837הורדות בחודש
  • 86לייקים

מה זה

מדובר במודל דחוס שמשלב יכולות קוד, הסקת מסקנות ועיבוד תמונה בקבוצת משקלים אחת, עם תמיכה בחלון הקשר של עד 262,144 טוקנים. הוא מאפשר לקבוע את עומק החשיבה לכל בקשה בנפרד, כך שאפשר להריץ מענה ישיר ומהיר או להפעיל מאמץ מחשוב כבד יותר למשימות ניתוח מעמיקות.

במבחני ביצועים למשימות פיתוח ואוטומציה הוא מגיע לתוצאה של 77.6% ב־SWE-Bench Verified ורושם 91.4% ב־τ³-Telecom. המספרים האלה מראים שהוא נבנה להתמודד עם פתרון בעיות קוד אמיתיות, קריאת פונקציות מובנית והחזרת פלט JSON מסודר, כשהוא מחליף דורות קודמים כמו Devstral 2 ו־Mistral Medium 3.1.

מתאים ל

  • סוכן לפיתוח ותיקון באגים

    מתאים לפתרון בעיות בריפוזיטורי בזכות תוצאה של 77.6% ב־SWE-Bench ויכולת קריאת פונקציות.

  • ניתוח מסמכים ותמונות ארוכים

    מטפל בטקסט ארוך ובתמונות במקביל בזכות חלון של 256k טוקנים ומפענח ראייה מובנה.

  • שירותי שיחה עם חשיבה עמוקה

    מאפשר לשנות את רמת מאמץ החשיבה בכל קריאה לפי מורכבות הפנייה של המשתמש.

איפה זה נופל

המודל תומך רשמית ברשימת שפות שכוללת אנגלית, צרפתית, ספרדית, גרמנית, איטלקית, פורטוגזית, הולנדית, סינית, יפנית, קוריאנית וערבית, אך עברית אינה מופיעה ברשימה הרשמית. בנוסף, חובה להגדיר ידנית את פרמטר ה־YaRN בהרצות מקומיות כדי למנוע איפוס של השיחה. מומלץ גם לכוונן את רמת החשיבה והטמפרטורה, שכן עבודה לא נכונה איתם עלולה לפגוע בדיוק התשובות.

שאלות
נפוצות

איך פותרים את בעיית השכחה של ההקשר בשיחה?

הבעיה נובעת מפענוח YaRN בכלים כמו llama.cpp. כדי לתקן אותה יש להעביר את הפרמטר mscale_all_dim לערך 0 בהגדרות ההרצה.

איך מומלץ לכוון את הטמפרטורה למשימות קוד ומחשבה?

כאשר מפעילים מאמץ חשיבה גבוה מומלץ להשתמש בטמפרטורה 0.7. למענה ישיר ומהיר ללא מנגנון חשיבה עדיף להישאר בטווח שבין 0.0 ל־0.7 כדי לקבל תשובות ממוקדות.

איך מריצים

המודל הזה דחוס ושוקל 128B בבסיסו, ולכן אי אפשר להריץ אותו על כרטיס ביתי רגיל. אתם צריכים שרת ייעודי עם מספר מאיצי GPU עתירי זיכרון או שרתי ענן בעלי נפח VRAM משמעותי כדי להחזיק את המשקלים ואת חלון ההקשר הגדול בפועל. אם אין לכם תשתית כזאת זמינה באופן קבוע, כנראה יהיה זול ופשוט יותר להשתמש בשירות ענן מנוהל.

בעבודה עם ספריות כמו llama.cpp ו־transformers, צריך לוודא שמשנים את ההגדרה mscale_all_dim מ־1 ל־0. ההגדרה הזו מטפלת בבאג של פענוח YaRN שגרם למודל לאבד את היסטוריית השיחה.

ollama run hf.co/unsloth/Mistral-Medium-3.5-128B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

74 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־Modified MIT. הוא מתיר שימוש מסחרי ובלתי מסחרי, אך כולל החרגות לחברות בעלות היקף הכנסות גבוה. אם אתם בונים מוצר בחברה גדולה, חובה לבדוק את נוסח הרישיון המקורי כדי לוודא שאינכם חורגים מהתנאים.

הרישיון המלא בעמוד המודל ↗