GPT
M

Moonlight-16B-A3B-Instruct

קוד פתוח

moonshotaimit2025-02-22

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

מודל מומחים שמחזיק כמעט 16 מיליארד פרמטרים אך מפעיל רק כ־3 מיליארד בכל שלב. הוא מציע מהירות של מודל קומפקטי עם ידע רחב, בלי לחנוק את המעבד הגרפי.

  • 16Bפרמטרים
  • 8,192טוקנים בהקשר
  • 29.7 GBמשקל הקבצים
  • 58,294הורדות בחודש

מה זה

הארכיטקטורה מבוססת על DeepSeek-V3 בפורמט תערובת מומחים. מתוך כמעט 16 מיליארד פרמטרים כוללים, רק 2.24 עד 3 מיליארד פעילים בכל טוקן נתון, מה שמצמצם את החישוב ומקצר את זמני התגובה בהשוואה למודלים צפופים בגודל דומה. הוא אומן על 5.7 טריליון טוקנים בעזרת אופטימייזר בשם Muon, שמגיע ליעילות חישובית גבוהה משמעותית מ־AdamW הרגיל.

במבחנים שמציגים המפתחים, הוא מנצח מודלים צפופים מובילים כמו Qwen2.5-3B ו־Llama 3.2-3B כמעט בכל תחום. ב־MMLU הוא עומד על 70 לעומת 65.6 של Qwen, ובמדדי קוד כמו HumanEval הוא רושם 48.1 לעומת 42.1. בבדיקות מתמטיקה כמו GSM8K הוא אמנם משיג 77.4 נקודות ונשאר מעט מאחורי Qwen שהגיע ל־79.1, אך במבחן MATH המורכב יותר הוא מוביל עם 45.3.

מתאים ל

  • הסקת קוד מקומית

    מתאים לשרתי פיתוח פנימיים שצריכים כתיבת קוד עם 48.1 ב־HumanEval, במהירות ריצה של מודל קטן.

  • עוזר שיחה חסכוני

    מספק תשובות ברמת ידע של 16B תוך שימוש בכוח חישוב של 3B בלבד לכל טוקן.

  • פתרון בעיות מתמטיות

    ציון 45.3 במבחן MATH מאפשר לו להתמודד בהצלחה עם משימות לוגיות מורכבות יחסית לגודלו.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים בלבד, מה שפוסל אותו מיידית לעיבוד מסמכים ארוכים או בסיסי קוד ענקיים. בנוסף, המדדים בבנצ'מרקים מתמקדים באנגלית ובסינית בלבד, שם הוא נבדק על C-Eval ו־CMMLU, ללא שום התייחסות או בדיקה לגבי עברית. במתמטיקה פשוטה ב־GSM8K הוא נופל ממתחרים צפופים כמו Qwen2.5, ולפני שמטמיעים אותו במוצר חובה לבדוק התמודדות עם שפות שאינן אנגלית ויציבות של הקוד המרוחק.

אותה משפחה

Moonlight יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אם הוא מפעיל רק 3B פרמטרים, למה צריך כרטיס עם יותר מ־30 גיגה זיכרון?

כל 16 מיליארד הפרמטרים חייבים לשבת בזיכרון ה־VRAM כדי שהמודל יוכל לנתב טוקנים למומחה המתאים בזמן אמת. כוח העיבוד של המעבד נדרש רק לחלק קטן מהם בכל שלב, אבל נפח הזיכרון חייב להכיל את המשקל המלא של 29.7 גיגה-בייט.

איך המודל מתמודד עם טקסטים ארוכים?

הוא מוגבל ל־8,192 טוקנים. זה מספיק לשיחות רגילות ולשאלות ממוקדות, אבל הוא לא מתאים לניתוח ספרים, קבצי PDF כבדים או הקשרים ארוכים שנפוצים במודלים חדשים אחרים.

איך מריצים

למרות שהוא רץ בפועל במהירות של 3B, הקבצים תופסים 29.7 גיגה-בייט בזיכרון בפורמט bfloat16 מלא. זה אומר שאי אפשר להריץ אותו על כרטיס ביתי פשוט עם 16 או 24 גיגה זיכרון בלי קוונטיזציה. תצטרכו כרטיס שרת של 32 עד 40 גיגה-בייט לפחות, או שרשור של שני כרטיסים צרכניים כדי להחזיק את כל המשקולות.

הוא נתמך ישירות בספריית transformers וגם במנועי הסקה כמו vLLM ו־SGLang בזכות התאימות למבנה של DeepSeek-V3. אם השרת שלכם לא מחזיק את נפח הזיכרון הדרוש לאחסון כל המומחים ברקע, עדיף להשתמש ב־API מנוהל מאשר לנסות להריץ אותו בצורה מקומית מגומגמת.

from transformers import pipeline

pipe = pipeline("text-generation", model="moonshotai/Moonlight-16B-A3B-Instruct")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא ופתוח. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תמלוגים או הגבלות שימוש מיוחדות, מלבד השארת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗