GPT
M

Magistral-Small-2509-GGUF

קוד פתוח

unslothapache-2.02025-09-17

  • vllm
  • gguf
  • mistral-common
  • unsloth
  • en

גרסת קוונטיזציה של מודל חשיבה וראייה עם 24 מיליארד פרמטרים. הוא מציע פתרון מקומי חזק למשימות קוד ומתמטיקה מורכבות על כרטיס מסך בודד.

  • 351 GBמשקל הקבצים
  • 3,695הורדות בחודש
  • 104לייקים

מה זה

הבסיס כאן הוא מיסטרל סמול 24B, שעבר אימון על שרשראות חשיבה וחיזוקים נוספים. התוצאה היא מודל שמייצר תהליך מחשבה פנימי בין תגיות ייעודיות לפני שהוא פולט תשובה סופית, בדומה למודלים המובילים בשוק אבל במשקל שניתן להריץ לבד. בנוסף, גרסה 1.2 כוללת יכולת ניתוח תמונה, כך שאפשר להזין לו דיאגרמות או בעיות ויזואליות ישירות לתוך שרשרת ההיגיון.

במבחנים התוצאות מראות שיפור ניכר מול גרסאות קודמות של הסדרה. ציון של 86.14 אחוז ב־AIME24 ו־70.88 אחוז ב־Livecodebench מעידים שהוא מתמודד היטב עם אלגוריתמיקה ותכנות מעבר לשיחה שגרתית, ומתקרב מאוד לביצועים של מודלים בקטגוריית גודל בינונית.

מתאים ל

  • פתרון בעיות קוד מקומי

    המודל מציג תוצאה של מעל 70 אחוז ב־Livecodebench ומייצר תהליך חשיבה מעמיק לאיתור באגים ללא תלות בענן.

  • ניתוח תרשימים טכניים

    שילוב יכולת ראייה עם מנגנון חשיבה מאפשר לו לפענח שרטוטים, דיאגרמות ותרשימי זרימה ישירות מהחומרה המקומית.

  • פיתוח אוטונומי ומאובטח

    התאמה מלאה לכרטיס מסך בודד ורישיון חופשי הופכים אותו לכלי אידיאלי לארגונים שאינם מורשים להוציא מידע החוצה.

איפה זה נופל

חלון ההקשר המוצהר הוא 128 אלף טוקנים, אך המפתחים מודים בפירוש שהביצועים עלולים להידרדר מעבר ל־40 אלף טוקנים. אם יש לכם מסמכים עצומים, אל תבנו על מלוא הטווח בלי לבדוק ירידה באיכות. עברית אינה מופיעה ברשימת השפות הנתמכות בכרטיס המודל, ולכן עיבוד בעברית עלול לכלול שגיאות או שבירת שרשרת החשיבה. תהליך ההסקה דורש שימוש קפדני בתבנית פרומפט מסוימת, ואם לא מגדירים נכון את תגיות החשיבה, הוא עלול לפלוט את המונולוג הפנימי ישירות לטקסט הסופי.

שאלות
נפוצות

האם המודל ירוץ בצורה סבירה על מחשב נייד בלי כרטיס מסך ייעודי?

לא. מדובר במודל של 24 מיליארד פרמטרים. על מעבד רגיל קצב פליטת הטוקנים יהיה איטי מאוד, בייחוד כשהוא מייצר מונולוג חשיבה ארוך לפני כל תשובה. נדרש כרטיס מסך מודרני עם 24 גיגה-בייט זיכרון או מקבוק עם 32 גיגה-בייט ומעלה.

למה המודל מחזיר טקסט בתוך תגיות מיוחדות?

הגרסה הזו מאומנת לייצר שרשרת חשיבה מוקדמת בתוך תגיות ייעודיות לפני התשובה הסופית. כדי להציג למשתמש רק את התוצאה הנקייה, יש לסנן בקוד שלכם את המידע שנמצא בין התגיות הללו.

האם כדאי להגביל את ההקשר שלו ל־40 אלף טוקנים?

המפתחים ממליצים להשאיר את ההגדרה על 128 אלף ולהוריד אותה רק אם מזהים ירידה בביצועים. אם המשימה שלכם כוללת טקסטים ארוכים במיוחד, מומלץ לבדוק את איכות התשובות באזור ה־40 אלף לפני הטמעה רחבה.

איך מריצים

המשקל הכולל של כלל קובצי ה־GGUF במאגר מגיע ל־351 גיגה-בייט, אך בפועל מורידים רק קובץ כיול בודד בהתאם לזיכרון הפנוי. בכיול נפוץ כמו UD-Q4_K_XL המודל נכנס בנוחות לכרטיס מסך בודד עם 24 גיגה-בייט זיכרון כמו RTX 4090, או למחשב מקבוק עם 32 גיגה-בייט זיכרון מאוחד.

אפשר להריץ אותו ישירות דרך פקודת llama.cpp או Ollama, ויש תמיכה גם בהרצה כשרת דרך vllm. אם אין לכם חומרה ייעודית מקומית עם לפחות 24 גיגה-בייט זיכרון, עדיף להשתמש ב־API מרוחק במקום לנסות לדחוף אותו למעבד רגיל שיזחל.

ollama run hf.co/unsloth/Magistral-Small-2509-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים ופרטיים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי העיקרי הוא שמירה על זכויות היוצרים וציון תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗