GPT
M

Ministral-8B-Instruct-2410

קוד פתוח

mistralaiother2024-10-15

  • vllm
  • safetensors
  • mistral
  • mistral-common
  • en

גרסת שמונה מיליארד פרמטרים שמתמקדת במשימות קצה ובקוד, ומיועדת למי שצריך הרצה מקומית חזקה בלי לחרוג מגודל כרטיס בודד.

  • 8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 29.9 GBמשקל הקבצים
  • 211,412הורדות בחודש

מה זה

מיסטרל מציגים כאן מודל קומפקטי שמכוון להתחרות בלאמה 3.1 ובגמה 2 באותו סדר גודל. בבדיקות של כתיבת קוד כמו HumanEval הוא מציג 76.8 אחוז לעומת 67.1 של לאמה 3.1, ובמבחן המתמטיקה של GSM8K בגרסת הבסיס הוא מגיע ל־64.5 אחוז מול 42.2 של המתחרה. בנוסף, שילבו בו תמיכה מובנית בהפעלת פונקציות.

הוא מאומן על חלון הקשר של 128 אלף טוקנים עם ארכיטקטורת תשומת לב מדורגת ומשתמש בטוקנייזר V3 Tekken שמכיל 131 אלף מונחים. השפות הרשמיות הנתמכות כוללות אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, סינית ויפנית. עברית לא מופיעה ברשימת השפות הנתמכות, ולכן כדאי לבדוק היטב איך הטוקנייזר מתמודד איתה לפני שמסתמכים עליו.

מתאים ל

  • עוזר פיתוח מקומי

    תוצאה של 76.8 אחוז במבחן HumanEval הופכת אותו למדויק במיוחד ביצירת קוד.

  • הפעלת פונקציות ואוטומציה

    הוא כולל תמיכה ייעודית לחיוג כלים ומגיע לתוצאה של 31.6 במבחן הפנימי.

  • תרגום וניתוח שפות אירופיות

    אימון ייעודי על צרפתית, גרמנית וספרדית עם תוצאות MMLU גבוהות מהמתחרים.

איפה זה נופל

המגבלה הטכנית הבולטת ביותר כרגע היא שבספריית vLLM חלון ההקשר מוגבל בפועל ל־32,768 טוקנים במקום 128 אלף, מאחר שחסרה עדיין תמיכה בליבות תשומת לב מיוחדות לפגינציה. בנוסף, מי שירצה לבצע משימות הקשר ארוכות מאוד דרך כלי ההרצה של מיסטרל יגלה שדרוש כרטיס של 80 גיגה בייט כדי להתמודד עם זיכרון הקלט. חסרון נוסף לקורא המקומי הוא היעדר תמיכה רשמית בעברית.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

המודל שוקל כמעט 30 גיגה בייט בפורמט המקורי ודורש 24 גיגה זיכרון גרפי להרצה ישירה. מחשב בלי מאיץ גרפי ייעודי מתאים יתקשה מאוד להפעיל אותו בקצב שמיש ללא המרה לקוונטיזציה.

איך מנצלים את כל 128 אלף הטוקנים של ההקשר?

נכון לעכשיו vLLM מגבילה את הריצה ל־32 אלף טוקנים בגלל מגבלת ליבות. מי שרוצה את מלוא האורך צריך להשתמש בספריית mistral inference, אך זה דורש חומרה עם 80 גיגה זיכרון לקטעים ארוכים.

האם מותר להטמיע אותו באפליקציה שלי לעסקים?

ההורדה מגיעה תחת רישיון מחקר בלבד ולא תחת רישיון אפאצ'י. כדי להשתמש בו מסחרית במוצר פעיל חובה לפנות ישירות למיסטרל ולהסדיר רישיון מולם.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־29.9 גיגה בייט בפורמט bfloat16, וכדי להרים אותו על מאיץ יחיד צריך לפחות 24 גיגה בייט של זיכרון גרפי. כדי להריץ בשרת מומלץ להשתמש ב־vLLM מגרסה 0.6.4 ומעלה יחד עם mistral common, או לחלק את העומס על שני מאיצים בעזרת מקביליות טנזורים.

אם אין לכם כרטיס מקומי עם 24 גיגה בייט פנויים, או אם אתם צריכים את מלוא ההקשר של 128 אלף טוקנים שדורש משאבים כבדים בהרבה, עדיף לפנות לממשק מרוחק במקום לנסות לדחוס אותו לחומרה חלשה.

pip install -U huggingface_hub
hf download mistralai/Ministral-8B-Instruct-2410

הרישיון

הרישיון מוגדר כ־Mistral Research License ולא רישיון פתוח רגיל. מותר להשתמש בו למחקר ולניסויים, אבל אסור להכניס אותו ישירות למוצר מסחרי בלי לקבל ממיסטרל אישור ורישיון בתשלום. מי שבונה שירות ללקוחות יצטרך ליצור איתם קשר לפני ההשקה.

הרישיון המלא בעמוד המודל ↗