GPT
M

Muse-Glimmer-30B-assistant

קוד פתוח

meta-modelsapache-2.02026-08-09

  • transformers
  • safetensors
  • muse_glimmer_assistant
  • feature-extraction
  • image-text-to-text

זהו מודל עזר קטן מבוסס DFlash שנועד להאיץ את ריצת המודל הראשי Muse Glimmer 30B. הוא מנחש 16 טוקנים בכל צעד כדי לחסוך זמני המתנה קריטיים במערכות מקומיות.

  • 2.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 59,098הורדות בחודש

מה זה

הקובץ הזה הוא מודל טיוטה קל משקל בגודל 2.6 מיליארד פרמטרים שמשתמש בארכיטקטורת DFlash block diffusion. במקום לייצר טקסט טוקן אחרי טוקן, הוא חוזה גושים שלמים של 16 טוקנים במעבר חישובי אחד. המודל הגדול יותר מאמת את ההצעות במקביל, מאשר את מה שנכון ומתקן שגיאות, בלי לפגוע באיכות הפלט הסופי.

במבחני המהירות השילוב הזה מקפיץ את הביצועים משמעותית. על כרטיס Nvidia RTX 5090 קצב הייצור מזנק מ־74.9 טוקנים בשנייה ל־233.4 טוקנים בשנייה, שיפור של פי 3.1. על מעבדי Apple Silicon כמו M4 Max ו־M5 Max השיפור נע בין פי 1.5 לפי 1.8, מה שהופך סוכנים מקומיים מבוססי תמונות וטקסט למהירים מספיק לעבודה רציפה.

מתאים ל

  • האצת סוכני קוד מקומיים

    משפר מהירות תגובה פי שלושה בהרצת Muse Glimmer 30B על גבי כרטיסי מסך מקומיים.

  • פענוח ספקולטיבי ב־DFlash

    מייצר גושים של 16 טוקנים במעבר יחיד עבור משימות טקסט ותמונה מורכבות.

  • עבודה מקומית על מחשבי מק

    מאפשר תגובה חלקה בזמן אמת על מעבדי M4 Max ו־M5 Max עם תוספת זיכרון מזערית.

איפה זה נופל

המודל הזה לא נועד לעבוד לבד, ואין לו יכולת לענות על שאלות בלי המודל הראשי שיאמת אותו. בנוסף, המהירות שלו תלויה לחלוטין באופי הטקסט, ובמשימות מורכבות שבהן קשה לחזות קדימה שיעור הקבלה של הטוקנים יורד ועימו גם התוספת למהירות. הדף מציין גם שהמודל לא נבדק על כל השפות שנכללו באימון, כך שבשפות כמו עברית שיעור הדיוק של הניחושים עלול להיות נמוך יותר.

שאלות
נפוצות

האם אפשר להריץ אותו כמודל צ'אט עצמאי?

לא. מדובר במודל טיוטה שמיועד אך ורק לפענוח ספקולטיבי לצד Muse Glimmer 30B. הוא אינו מאומן לספק תשובות מלאות או לעבוד כמנוע עצמאי.

איזו חומרה צריך כדי ליהנות מהאצת המהירות?

החומרה נקבעת לפי המודל הראשי. גרסת ה־4 ביט שלו יחד עם מודל הטיוטה הזה דורשת לפחות 24GB זיכרון גרפי, כמו בכרטיס RTX 5090 או במחשבי מק תואמים.

איך מריצים

אין שום טעם להריץ את המודל הזה לבד כי הוא לא מודל שיחה עצמאי. אתם טוענים אותו כראש עזר לצד Muse Glimmer 30B באמצעות ספריית transformers, llama.cpp או ExecuTorch.

כדי להריץ את שניהם יחד בקוונטיזציה של 4 ביט תצטרכו כרטיס מסך עם לפחות 24GB של זיכרון גרפי, כמו RTX 5090 או מחשב מק עם זיכרון מאוחד של 32GB לפחות. משקל הקבצים של העוזר עצמו הוא 4.8 גיגהבייט והוא דורש מעט מאוד זיכרון נוסף מעבר למודל הראשי. אם אין לכם חומרה כזו עם מספיק זיכרון גרפי פנוי, עדיף להשתמש ב־API בענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="meta-models/Muse-Glimmer-30B-assistant")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 4.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקבצים, להפיץ אותם מחדש ולשלב אותם בתוך מוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗