GPT
M

Magistral-Small-2506-GGUF

קוד פתוח

unslothapache-2.02025-06-10

  • gguf
  • mistral
  • unsloth
  • en
  • fr

גרסת GGUF מכווצת של מודל חשיבה עם 24 מיליארד פרמטרים מבית מיסטרל. הוא מציע שרשראות חשיבה ארוכות בחומרה מקומית נגישה.

  • 351 GBמשקל הקבצים
  • 1,422הורדות בחודש
  • 97לייקים

מה זה

הבסיס כאן הוא Mistral Small 3.1 שעבר אימון ייעודי על עקבות חשיבה של מודל גדול יותר וחיזוק באמצעות RL. המטרה היא להביא יכולות היסק ופתרון בעיות מעמיק לנפח של 24B פרמטרים, בלי להזדקק לחוות שרתים ענקית. יש כאן תמיכה מובנית בריבוי שפות ותמיכה ניסיונית בראייה.

במדדים הוא קרוב מאוד לאחיו הגדול. הוא מגיע ל־70.68% ב־AIME24 ול־68.18% ב־GPQA Diamond. במבחן הקוד Livecodebench הוא מוציא 55.84%. המשמעות היא יכולת פתרון בעיות מתמטיות ולוגיות ברמה גבוהה מאוד ביחס למשקל שלו, גם אם בקוד מורכב הוא עדיין מתקשה יותר.

מתאים ל

  • פתרון בעיות לוגיות מורכבות

    יכולת שרשרת החשיבה מאפשרת לפרק חישובים ואלגוריתמים לפני הפלט הסופי.

  • פיתוח מקומי במחשב יחיד

    המשקל המכויל מתאים לכרטיס RTX 4090 אחד או מק עם 32GB זיכרון.

  • יישומי קוד ממוקדים

    ציון של 55.84% ב־Livecodebench מספק בסיס טוב לכתיבה ובדיקת פונקציות.

איפה זה נופל

חלון ההקשר המלא מוגדר רשמית כ־128k טוקנים, אבל היוצרים מזהירים במפורש שהביצועים מתחילים להתדרדר מעבר ל־40k. בפועל מומלץ להגביל אותו ל־40,960 טוקנים בלבד. מעבר לזה, רשימת השפות הנתמכות כוללת עשרות שפות אך עברית אינה מופיעה בה, כך שצריך לבדוק היטב את איכות הפלט לפני שמסתמכים עליו בעברית.

שאלות
נפוצות

האם הוא יעבוד טוב עם טקסטים ארוכים מעל 40 אלף טוקנים?

ההקשר התיאורטי תומך עד 128k, אך הכרטיס מציין בפירוש ירידה בביצועים מעבר ל־40k. מומלץ לקבע את האורך המקסימלי על 40,960 טוקנים כדי לקבל תוצאות יציבות.

איזו חומרה מינימלית צריך כדי להריץ אותו?

בגרסה המכווצת תצטרכו כרטיס מסך עם 24GB זיכרון כמו RTX 4090, או מחשב מק עם זיכרון אחוד של 32GB לפחות.

איך מריצים

אחרי כימות, הוא נכנס בכרטיס מסך יחיד כמו RTX 4090 או במחשב מק עם 32GB זיכרון. ההרצה נעשית דרך llama.cpp או Ollama, כשחובה להגדיר את דגל jinja כדי שהפרומפט של המערכת יעבוד. הפרמטרים המומלצים הם טמפרטורה 0.7 ו־top_p של 0.95.

גרסת ה־UD-Q4_K_XL מתאימה למי שרוצה להתחיל לעבוד מקומית בלי סיבוכים. אם אין לכם כרטיס עם 24GB VRAM לפחות, כדאי לשקול קריאה לשרת vLLM מרוחק או לשירות ענן, אחרת מהירות יצירת הטוקנים תרד משמעותית.

ollama run hf.co/unsloth/Magistral-Small-2506-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון Apache 2.0 פתוח ומאפשר שימוש מסחרי, שינוי והפצה של המודל ללא תמלוגים. אתם יכולים לשלב אותו במוצרים פנימיים או מסחריים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗