GPT
M

meta-models/Muse-Glimmer-30B-GGUF

קוד פתוח

meta-modelsapache-2.02026-08-09

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

שילוב של מודל שפה עם רשת ראייה בנפח של 30 מיליארד פרמטרים, שנועד למשימות של סוכנים אוטונומיים על חומרה ביתית. הוא מחבר הפעלת כלים, התאוששות משגיאות ופענוח מואץ ללא תלות בשרת חיצוני.

  • 36.7 GBמשקל הקבצים
  • 512,593הורדות בחודש
  • 333לייקים

מה זה

מדובר במודל שזוקק מ־Muse Spark וכוון לעבודה עם סוכנים שמריצים קוד, מתמודדים עם תקלות בזמן אמת ומנתחים תמונות לצד טקסט. המבנה שלו כולל דחיסה של מודל השפה יחד עם מודול ראייה של 1.8 מיליארד פרמטרים ומנגנון DFlash לחיזוי בלוקים של טוקנים, מה שמאפשר קצב יצירה גבוה בהרבה מחלופות מקבילות בגודל הזה.

במבחני ביצועים לסוכנים הוא עוקף מתחרים כמו Gemma4-31B ו־Qwen3.6-27B, במיוחד במשימות עבודה ממושכות כמו MCP Atlas שבו הגיע לציון 75.5 לעומת 62.5 של המתחרה הקרוב, וב־SWE-Bench Pro שבו הגיע ל־51.2. עם זאת, במבחני ידע וקריאת מסכים כמו ScreenSpot Pro או OSWorld, המודלים המתחרים עדיין מובילים עליו.

מתאים ל

  • סוכן מקומי לתיקון קוד

    מתאים להרצה בתוך סביבת פיתוח בזכות ציונים של 51.2 ב־SWE-Bench ויכולת התאוששות מתקלות.

  • אוטומציה מבוססת צילומי מסך

    יודע לנתח תמונות וממשקים לצד שיחה באמצעות אנקודר הראייה המובנה של 1.8 מיליארד פרמטרים.

  • הפעלת כלים במערכות סגורות

    מאפשר הרצה מקומית מלאה של קריאות לפונקציות ושרשור משימות בלי להוציא מידע רגיש החוצה.

איפה זה נופל

הבעיה המרכזית היא שאי אפשר לכבות את החשיבה המובנית שלו. אם אתם צריכים תשובות מהירות או זולות במיוחד, הוא עדיין יפתח ערוץ חשיבה, והשליטה היחידה היא על העוצמה שלו דרך התבנית או הגבלת תקציב טוקנים. בנוסף, אם מגדירים מפתחות הקשר בשרת עם חלוקה לכמה בקשות במקביל וההקשר של הסלוט נגמר באמצע החשיבה, הוא פשוט לא מחזיר תשובה בלי להציג שגיאה בלוגים.

בנוסף, הכרטיס מציין במפורש שהמודל לא עבר אופטימיזציה לווידאו אלא מטפל בו כפריימים נפרדים, והביצועים שלו על שפות שלא נבדקו ביסודיות עלולים לרדת, נקודה שקריטית לבדיקה אם אתם בונים שירות בעברית שאינה שפת היעד העיקרית שלו.

אותה משפחה

Muse-Glimmer יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ רק את מודל הטקסט בלי תמונות כדי לחסוך זיכרון?

כן. קובץ הטקסט הבסיסי שוקל 16.8 גיגה בגרסת 17GB ויכול לעבוד לבד במסגרת של 17 גיגה זיכרון גרפי. אנקודר הראייה והדראפטר הם קבצים נפרדים לחלוטין שמוסיפים רק אם יש צורך בניתוח תמונות או בהאצת מהירות הכתיבה.

למה המודל חותך את התשובות שלו באמצע עבודה עם כלים?

ברוב המקרים זה קורה בגלל עצירה שגויה על הטוקן eom, שמסמן סיום הודעה בודדת ולא סיום תור מלא של פעולות. אסור להגדיר אותו כטוקן עצירה בלקוח שלכם, אלא להשאיר רק את end_of_text ואת eot.

איך מריצים

בשביל להריץ את הגרסה הקלה של 17 גיגה־בייט בקוונטיזציה של 4 ביט יחד עם הראייה והדראפטר, תצטרכו כרטיס עם לפחות 24 גיגה זיכרון גרפי, כמו RTX 5090 שמגיע לפי הבדיקות ל־233 טוקנים לשנייה, או מחשב מק עם מעבדי M4 Max ומעלה. לגרסת ה־Dynamic ששוקלת כמעט 20 גיגה נדרש כרטיס של 32 גיגה. חובה להשתמש בגרסת llama.cpp מספר b10353 ומעלה, כי גרסאות קודמות פשוט לא מזהות את הארכיטקטורה.

אם אין לכם כרטיס עם 24 גיגה VRAM פנוי לפחות, המודל ייפול לזיכרון הראשי והביצועים יתרסקו, ולכן במקרים כאלה עדיף להשתמש ב־API מרוחק. בנוסף, חובה להעביר את הדגל jinja בריצה, אחרת התבנית המובנית תיכשל והשרת יקרוס.

ollama run hf.co/meta-models/Muse-Glimmer-30B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים משוחררים תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים ולספק שירותים בתשלום סביבו. התנאים מחייבים שמירה על הודעות זכויות היוצרים והרישיון המקורי, והגבלת האחריות של המפתחים המקוריים לכל נזק שייגרם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗