GPT
M

Mistral-Small-24B-Instruct-2501-GGUF

קוד פתוח

bartowskiapache-2.02025-01-30

  • gguf
  • text-generation
  • en
  • fr
  • de

גרסת קוונטיזציה של מודל ההוראות Mistral Small בגודל 24 מיליארד פרמטרים. הוא נבנה למי שצריך מודל שפה חזק שרץ מקומית ולא תלוי בספקים חיצוניים.

  • 430 GBמשקל הקבצים
  • 8,372הורדות בחודש
  • 111לייקים

מה זה

המודל הזה הוא גרסת GGUF שנוצרה על ידי bartowski עבור llama.cpp, כשהבסיס הוא מודל ההוראות בגודל 24B ששחררה מיסטרל בסוף ינואר 2025. כל הגרסאות כאן עברו כיול imatrix, מה ששומר על איכות הטקסט גם כשדוחסים את המשקלים לגדלים צנועים יותר.

בטווח הגדלים הזה הוא יושב בדיוק בין מודלי ה־8B הקלים לבין ה־70B הכבדים. זה אומר שהוא מציע הבנה טובה יותר של הוראות מורכבות וקוד בלי לדרוש שרת ייעודי של כמה כרטיסים, כל עוד עובדים באחת מהשפות הנתמכות כמו אנגלית, צרפתית, ספרדית או גרמנית.

מתאים ל

  • עוזר פיתוח מקומי

    רץ ישירות בתוך סביבת הפיתוח עם LM Studio בלי לשלוח קוד פנימי של החברה לשום שרת צד שלישי.

  • עיבוד מסמכים באנגלית

    מספק יכולת ניתוח טובה מגרסאות 8B קטנות ונכנס כולו בכרטיס מסך בודד של 16 או 24 גיגה.

  • הסקה על שרתי ARM

    פורמט Q4_0 תומך בסידור משקלים אוטומטי בזמן ריצה ומפיק ביצועים טובים יותר על מעבדי שרת.

איפה זה נופל

עברית לא מופיעה ברשימת השפות הנתמכות של המודל. הוא יודע לעבוד עם אנגלית וכמה שפות אירופיות ואסייתיות, כך שאם המוצר שלכם פונה לשוק המקומי, סביר להניח שתקבלו פלטים שבורים או תרגום עילג. בנוסף, גרסאות ה־IQ הדחוסות מתחת ל־Q4 לא תואמות לעבודה עם Vulkan, ועל מעבדים רגילים או אפל סיליקון הן עלולות לרוץ לאט יותר מגרסאות K מקבילות.

שאלות
נפוצות

איזה קובץ צריך להוריד מתוך כל הרשימה?

לרוב השימושים מתחילים עם Mistral-Small-24B-Instruct-2501-Q4_K_M.gguf ששוקל 14.33 גיגה. אם יש לכם פחות זיכרון בכרטיס המסך תרדו ל־IQ4_XS או Q3_K_L, ואם יש כרטיס עם 24 גיגה עדיף לקחת את Q5_K_M או Q6_K שנותנים דיוק קרוב למקור.

המודל מתאים לשימוש באפליקציות בעברית?

לא. רשימת השפות הרשמית כוללת אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, סינית ויפנית בלבד. הוא לא אומן עבור עברית ולא כדאי לבנות עליו למשימות בשפה הזו.

איך מריצים

כדי להריץ אותו צריך כלי כמו LM Studio או llama.cpp ישירות. גרסת ברירת המחדל שמומלצת לרוב האנשים היא Q4_K_M ושוקלת 14.33 גיגה בייט, כך שהיא דורשת כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לרוץ כולה על המעבד הגרפי בלי לזחול. אם יש לכם כרטיס צרכן של 8 או 12 גיגה, תצטרכו לרדת לגרסאות דחוסות יותר כמו IQ3_M או לפצל חלק מהשכבות לזיכרון המערכת, מה שיפגע בקצב יצירת הטקסט.

מי שאין לו כרטיס מתאים עם 16 עד 24 גיגה VRAM יגלה מהר מאוד שהרצה על מעבד בלבד איטית ומייבשת. במצב כזה עדיף לשלם לפי טוקן לשרת ענן שמריץ את המודל המקורי במקום להשקיע בחומרה.

ollama run hf.co/bartowski/Mistral-Small-24B-Instruct-2501-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

31 קבצים במאגר, 430 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר לקחת אותו, לשלב אותו במוצר מסחרי, לשנות את הקוד ולהריץ אותו באופן פנימי בלי לשלם תמלוגים ובלי חובה לפתוח את הקוד שלכם, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗