GPT
M

Moonlight-16B-A3B

קוד פתוח

moonshotaimit2025-02-22

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

מודל מומחים שדורש 16 מיליארד פרמטרים בזיכרון אבל מפעיל רק כ־3 מיליארד בכל שלב. הוא אומן באמצעות אופטימייזר ייעודי ומציג ביצועי קוד ושפה גבוהים ביחס לכוח החישוב שהושקע בו.

  • 16Bפרמטרים
  • 8,192טוקנים בהקשר
  • 29.7 GBמשקל הקבצים
  • 16,751הורדות בחודש

מה זה

מדובר במודל שפה בארכיטקטורת תערובת מומחים המבוססת על DeepSeek-V3, שפותח כדי להוכיח שאפשר לאמן מודלים גדולים ביעילות באמצעות האופטימייזר Muon על גבי 5.7 טריליון טוקנים. הרעיון המרכזי הוא שימוש בזיכרון של מודל בינוני תוך חישוב מהיר וקל בהרבה של מודל קטן, כאשר בכל טוקן פעילים כ־2.24 מיליארד פרמטרים בלבד מתוך מעל 15 מיליארד בסך הכל.

במדדים שפורסמו על ידי המפתחים, המודל מציג יתרון מובהק על פני מודלים בעלי כמות פרמטרים פעילה דומה, כמו Llama 3.2 3B או Qwen 2.5 3B. הוא מוביל במבחני ידע כללי כמו MMLU עם ציון 70.0 לעומת 65.6 של המתחרה הסיני, ורושם 48.1 נקודות במבחן כתיבת הקוד HumanEval לעומת 42.1 של המתחרים, לצד תוצאות חזקות במתמטיקה ובסינית.

מתאים ל

  • בסיס לכיוונון משימות מותאם

    מודל קומפקטי עם ידע רחב, שמאפשר לאמן מומחה פנימי על דאטה ייעודי בעלות חישוב נמוכה.

  • השלמת קוד מקומית

    מציג 48.1 במבחן HumanEval ופועל במהירות של מודל 3B קטן, מה שמתאים לעבודה מהירה בתוך IDE.

  • מחקר על יעילות אימון

    נקודת מוצא פתוחה לבדיקת התנהגות האופטימייזר Muon וארכיטקטורת DeepSeek-V3 על חומרה קיימת.

איפה זה נופל

החיסרון המרכזי של מודל הבסיס הוא הצורך בהתאמה נוספת לפני כל שימוש אינטראקטיבי, משום שהוא פשוט מנחש את המילים הבאות ואינו מיושר למענה על שאלות. מעבר לכך, חלון ההקשר מוגבל ל־8,192 טוקנים, אורך קצר ביחס למודלים מודרניים אחרים, מה שפוסל אותו לעיבוד מסמכים כבדים או קבצי קוד שלמים. אין בכרטיס המודל שום מידע על תמיכה בעברית, כך שיש לבדוק את איכות הפלט והטוקניזציה לפני שמסתמכים עליו בשפה זו.

אותה משפחה

Moonlight יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי יחיד?

לא ברמת הדיוק המקורית של הקבצים, שתופסת כ־30 גיגה-בייט זיכרון גרפי. כרטיסים צרכניים מגיעים לרוב עד 24 גיגה-בייט, ולכן תצטרכו להשתמש בגרסה שעברה קוונטיזציה או לחלק את המודל על פני שני כרטיסים.

מה ההבדל בינו לבין מודל רגיל של 3 מיליארד פרמטרים?

הוא מכיל בסיס ידע רחב פי כמה בזכות 16 מיליארד פרמטרים שנשמרים בזיכרון, אבל שומר על מהירות תגובה של מודל קטן כי הוא מפעיל רק כ־2.24 מיליארד מהם בכל פעולת ניבוי.

האם המודל מוכן לשימוש ישיר כמנוע צ'אט?

לא, מדובר במודל Pretrained גולמי שנועד להשלמת טקסט ולא עבר אימון שיחה. למשימות שדורשות הבנת שאלות והחזרת תשובות ישירות, המפתחים שחררו גרסה נפרדת בשם Moonlight-16B-A3B-Instruct.

איך מריצים

כדי להריץ אותו צריך להחזיק את כל 16 מיליארד הפרמטרים בזיכרון ה־VRAM, גם אם רק חלקם מחושבים בזמן אמת. הקבצים שוקלים 29.7 גיגה-בייט בפורמט המקורי, מה שמחייב כרטיס מקצועי יחיד של 40 או 80 גיגה-בייט כמו A100, או פיצול בין שני כרטיסים צרכניים של 24 גיגה-בייט, לצד תמיכה בארכיטקטורת DeepSeek בתוכנת ההסקה.

הגרסה הזו היא מודל בסיס לאימון המשך ולא מודל צ'אט, כך שהיא תשלים טקסט ולא תנהל שיחה ישירה עם משתמשים. אם אתם זקוקים למודל שעונה להוראות ישירות, יש להוריד את גרסת ה־Instruct, ואם אין לכם תשתית עיבוד שמחזיקה 30 גיגה-בייט זיכרון גרפי פנוי, עדיף להשתמש במודל דחוס או בשרת ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="moonshotai/Moonlight-16B-A3B")
print(pipe("שלום"))

הרישיון

רישיון MIT. מותר לעשות עם הקוד והמשקלים הכל, כולל שימוש מסחרי, שינוי, הפצה ומכירה בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור המקוריים בכל עותק שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗