GPT
M

Mistral-Small-24B-Instruct-2501

קוד פתוח

mistralaiapache-2.02025-01-28

  • vllm
  • safetensors
  • mistral
  • en
  • fr

גרסה מכווננת להוראות עם 24 מיליארד פרמטרים שמתחרה ישירות בדגמים של 70 מיליארד. היא מספקת יכולות חזקות לקריאת פונקציות ופלט מובנה תחת רישיון פתוח לחלוטין.

  • 24Bפרמטרים
  • 32,768טוקנים בהקשר
  • 87.8 GBמשקל הקבצים
  • 44,051הורדות בחודש

מה זה

המשקל של 24 מיליארד פרמטרים מציב את הדגם הזה בנקודה מעניינת. הוא חזק משמעותית מדגמים קטנים של 7 או 8 מיליארד, ומציג תוצאות שמתקרבות מאוד לדגמי ענק כמו Llama 3.3 70B בבדיקות חשיבה וקידוד. במבחן MMLU Pro הוא מגיע לתוצאה של 0.663, שזה כמעט זהה לתוצאה של הדגם הגדול מבית מטא. במבחני שיפוט אנושי על פרומפטים כלליים וקוד, בודקים העדיפו אותו בבירור על פני Gemma 2 27B ו־Qwen 2.5 32B.

הוא מיועד בעיקר למי שבונה סוכנים או זקוק לשיחות מבוססות כלים. יש לו תמיכה מובנית ב־function calling ובפליטה של JSON, מה שהופך אותו לבחירה טובה לתהליכים אוטומטיים. טוקנייזר ה־Tekken מגיע עם אוצר מילים של 131 אלף מונחים, וההקשר עומד על 32,768 טוקנים, שזה מספיק למרבית המשימות העסקיות אבל לא למסמכי ענק של מאות עמודים.

מתאים ל

  • סוכנים עצמאיים וקריאת כלים

    תמיכה טבעית ב־function calling ובפלט JSON מאפשרת הפעלה אמינה של ממשקי תוכנה ופקודות אוטומטיות.

  • עוזר שיחה על חומרה מקומית

    לאחר כימות, המודל רץ ישירות על כרטיס 4090 או מקבוק עם 32GB לטיפול במידע רגיש ללא שליחה לענן.

  • אימון וכיול למשימות ייעודיות

    משמש כבסיס ידע צפוף שמתאים ל־fine tuning עבור מומחי תחום מבלי לשלם על עלויות שרת של דגמי 70B.

איפה זה נופל

בסיס הידע של הדגם נעצר באוקטובר 2023, כך שהוא לא מכיר שום אירוע או עדכון טכנולוגי מאז. בנוסף, חלון ההקשר מוגבל ל־32 אלף טוקנים. אם המוצר שלכם נשען על קריאת ספרי קוד ענקיים או מסדי נתונים שלמים בבת אחת, תרגישו את המגבלה הזו מהר מאוד לעומת מודלים מתחרים שמציעים מאה אלף טוקנים ויותר.

בגזרת המתמטיקה והקידוד היבש הוא מציג חולשה מסוימת מול Qwen 2.5 32B, שמוביל עליו במבחני HumanEval ו־MATH. אם המטרה העיקרית שלכם היא מנוע לפתרון בעיות הנדסיות מורכבות, יש אלטרנטיבות חזקות יותר בנפח דומה.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על המחשב הנייד שלי?

זה אפשרי רק אם מדובר במחשב מק עם לפחות 32 גיגה בייט של זיכרון אחוד, ותצטרכו להשתמש בגרסה מכומתת דרך Ollama. במחשבי PC רגילים ללא כרטיס מסך עם 24 גיגה בייט זיכרון גרפי ייעודי, הוא ירוץ לאט מדי או יקרוס מחוסר זיכרון.

מה צריך לכתוב בהנחיית המערכת של הדגם הזה?

היוצרים ממליצים להגדיר בהנחיית המערכת את תאריך סיום הידע לאוקטובר 2023 ואת התאריך הנוכחי. בנוסף כדאי להנחות אותו במפורש להודות בחוסר ידע ולבקש הבהרות במקום לנחש כשהשאלה של המשתמש עמומה.

איך הביצועים שלו בהשוואה לדגמי ענן פופולריים כמו GPT-4o mini?

במבחני דירוג אנושי הוא מנצח את GPT-4o mini ב־20% מהמקרים, אך המודל של OpenAI מציג עדיפות ברורה ב־31% מהבדיקות. במבחני ידע וחשיבה כלליים כמו MMLU Pro ו־GPQA, הדגם של מיסטרל משיג ציונים גבוהים יותר.

איך מריצים

כדי להריץ אותו בלי כימות בדיוק המקורי של bfloat16 תצטרכו כ־55 גיגה בייט של זיכרון גרפי. זה אומר שחומרה של כרטיס בודד לצרכנים לא תספיק, ותצטרכו שרת עם שני כרטיסים או כרטיס שרת ייעודי. מומלץ להרים שרת באמצעות ספריית vLLM מגרסה 0.6.4 ומעלה יחד עם חבילת mistral_common, ולהגדיר טמפרטורה נמוכה של 0.15 לפי המלצת המפתחים.

אם אתם רוצים להריץ מקומית על שולחן העבודה, הפתרון הוא כימות. ברגע שמכמתים את המשקלים, אפשר לדחוף אותו לכרטיס Nvidia RTX 4090 יחיד עם 24 גיגה בייט זיכרון, או למחשב מקבוק עם 32 גיגה בייט זיכרון אחוד דרך Ollama. אם אתם לא רוצים להתעסק עם שרתים כבדים או ירידה בדיוק של הכימות, קריאה ל־API תהיה פשוטה וזולה יותר לתעבורה נמוכה.

pip install -U huggingface_hub
hf download mistralai/Mistral-Small-24B-Instruct-2501

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים פרטיים. אין מגבלות על היקף ההכנסות או חובה לחשוף את הפיתוחים שלכם, מה שמאפשר להטמיע אותו במוצרים מסחריים בלי דאגות משפטיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗