GPT
M

Mistral-Small-4-119B-2603-GGUF

קוד פתוח

unslothapache-2.02026-03-17

  • gguf
  • vLLM
  • unsloth
  • ar
  • en

גרסת GGUF של מיסטרל המשלבת יכולות ראייה, קוד וחשיבה מתמטית עם חלון של 256 אלף טוקנים. היא מיועדת למי שרוצה ביצועים של מודל ענק עם עלות חישוב של 6.5 מיליארד פרמטרים פעילים בלבד.

  • 1.6 TBמשקל הקבצים
  • 12,317הורדות בחודש
  • 84לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים שכוללת 119 מיליארד פרמטרים, אבל מפעילה רק 6.5 מיליארד בכל טוקן דרך ארבעה מומחים פעילים מתוך 128. המבנה הזה נותן מהירות תגובה גבוהה בהרבה ממודלים דחוסים בגודל דומה, ומאפשר לשלב קלט של טקסט ותמונות יחד.

המודל כולל מנגנון שמאפשר לקבוע את רמת המאמץ המחשבתי בכל פנייה, ממענה ישיר ומהיר ועד חשיבה עמוקה בשלבים. בבדיקות של המפתחים הוא משיג ציון של 0.72 במבחן AA LCR באורך פלט של 1.6 אלף תווים בלבד, שזה רבע מכמות המלל שמודלים מתחרים פולטים כדי להגיע לתוצאה מקבילה. הוא מתוכנן לעבוד עם קריאות לפונקציות ופלט JSON מובנה.

מתאים ל

  • סוכני פיתוח ותכנות

    הוא כולל תמיכה מובנית בהפעלת כלים, פלט מקוצר וחשיבה מתמטית שמתאימה לניתוח קוד וכתיבת בדיקות.

  • ניתוח מסמכים ותמונות

    קלט המולטימודל יחד עם חלון ענק מאפשר לטעון תמונות וקבצים טכניים ארוכים לצורך חילוץ נתונים מובנה.

  • עבודה מבוססת חשיבה משתנה

    היכולת לכבות או להפעיל את זמן החשיבה לפי קריאה מאפשרת לאזן בין עלות לדיוק במערכות שירות.

איפה זה נופל

התמיכה הטכנית בהרצה המקומית עדיין נמצאת בעבודה. ב־llama.cpp וב־SGLang החיבור מוגדר עדיין כעבודה בתהליך, ובסביבת Transformers אין תמיכה מובנית בפורמט FP8 שבו נשמרו המשקלים המקוריים, מה שמחייב שימוש בגרסאות פיתוח או תמונות דוקר ייעודיות כדי לקבל פענוח תקין של קריאות לכלים. בנוסף, רשימת השפות הנתמכות בכרטיס כוללת ערבית, אנגלית, צרפתית, ספרדית, גרמנית, איטלקית, פורטוגזית והולנדית, אך עברית אינה מופיעה ברשימה הרשמית הזו ויש לבדוק את איכותה בנפרד.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך בודד של 16GB?

לא. מדובר במודל של 119 מיליארד פרמטרים, שדורש עשרות ג'יגה בייט של זיכרון רק כדי להיטען, עוד לפני הקצאת מקום להקשר השיחה. תצטרכו שרת עם כמה כרטיסים ייעודיים או מעבד גרפי עתיר זיכרון.

מה המשמעות של הפעלת מצב הניתוח המעמיק?

הפרמטר reasoning_effort מאפשר לקבוע כמה שלבי חשיבה המודל מייצר לפני הפלט הסופי. במצב כבוי הוא עונה מיידית בסגנון צ'אט מהיר, ובמצב גבוה הוא מפרט את שלבי הפתרון בדומה למודלים ייעודיים למתמטיקה ולוגיקה.

איך מריצים

הקובץ שוקל עשרות ג'יגה בייט בגרסאות הקוונטיזציה השונות, ומאגר המשקלים המלא מגיע ל־1.6 טרה בייט. כדי להריץ גרסה מכווצת של מודל 119B תצטרכו לפחות שני כרטיסי מסך חזקים או שרת עם זיכרון וידאו נרחב, במיוחד אם תרצו לנצל חלק מחלון ההקשר המלא של 256 אלף טוקנים.

ההרצה נעשית דרך llama.cpp עם דגל jinja לתבנית השיחה, או בסביבות שרת כמו vLLM. אם אין לכם חומרה ייעודית עם עשרות ג'יגה בייט זיכרון גרפי פנוי, עדיף להשתמש ב־API מרוחק במקום לנסות להריץ אותו מקומית על מחשב אישי.

ollama run hf.co/unsloth/Mistral-Small-4-119B-2603-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

68 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים, לשנות אותו ולהפיץ אותו הלאה, כל עוד שומרים על תנאי הרישיון המקורי, הודעות זכויות היוצרים, ולא מפרים זכויות צד שלישי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗