GPT
M

Marco-Nano-Instruct

קוד פתוח

ATH-MaaSapache-2.02026-04-03

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • moe

מודל תערובת מומחים דליל במיוחד שמפעיל רק 600 מיליון פרמטרים מתוך שמונה מיליארד, ומספק מהירות ריצה גבוהה לצד ביצועים רב לשוניים תחרותיים.

  • 8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.9 GBמשקל הקבצים
  • 1,617הורדות בחודש

מה זה

המודל בנוי על ארכיטקטורת MoE דלילה שמבוססת על Qwen3, עם 232 מומחים שמתוכם שמונה בלבד פעילים בכל טוקן. המשמעות היא שאתם מחזיקים בזיכרון מודל מלא, אבל משלמים עלויות חישוב של מודל זעיר. התוצאות מראות שהוא מוביל במבחנים כלליים ורב לשוניים מול מודלים קטנים אחרים, במיוחד בהבנת שפות שאינן אנגלית ובמשימות מתמטיקה בסיסיות.

תהליך האימון שלו כלל זיקוק ישיר ממודלים ענקיים כמו Qwen3-Next, מה שמסביר למה הוא מצליח להוציא ציונים מפתיעים למרות שהוא דורש מעט מאוד כוח עיבוד פר טוקן. זה לא פתרון לבעיות חשיבה עמוקות, אבל הוא יעיל במיוחד כשצריך לנתב ולעבד טקסט בהיקפים גדולים בלי לשרוף שרתים יקרים.

מתאים ל

  • תרגום טקסטים מהיר

    משיג ציוני BLEU גבוהים יחסית למודלים קטנים בתרגום בין עשרות שפות.

  • פתרון בעיות מתמטיקה בסיסיות

    עוקף מתחרים במבחני GSM8K בזכות אימון ייעודי וזיקוק ממודלים חזקים.

  • עיבוד מנות טקסט בזול

    מפעיל רק 0.6B פרמטרים בחישוב ומאפשר תפוקת טוקנים גבוהה מאוד בחומרה מתאימה.

איפה זה נופל

החולשה הבולטת שלו היא חשיבה מדעית מורכבת ברמה אקדמית. במבחני GPQA ו־MGPQA הוא קיבל ציונים נמוכים משמעותית ביחס למתחרים בגודל דומה, סביב 21 עד 22 אחוז בלבד. בנוסף, למרות שהרשימה כוללת עברית, אין נתוני מדידה ייעודיים עבורה בכרטיס המודל. אסור להסתמך עליו למשימות היגיון סבוכות או פתרון בעיות קצה בלי בדיקה מקיפה של איכות הפלט בעברית.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך ביתי חלש?

הוא ידרוש לפחות כרטיס עם 16GB זיכרון כדי להחזיק את כל המשקולות, למרות שכוח העיבוד הנדרש נמוך. אם אין לכם מספיק VRAM לכל 15 הג'יגה בייט של הקבצים, הוא לא ייטען.

איך התמיכה שלו בעברית?

עברית רשומה ברשימת השפות הנתמכות, אך אין עליה מבחני ביצועים ספציפיים בכרטיס המודל. כדאי להריץ עליו מבחנים ממוקדים לפני שמשלבים אותו במערכת שתלויה בשפה הזו.

איך מריצים

בפועל אתם מורידים קבצים במשקל כולל של כמעט 15 ג'יגה בייט, כך שצריך כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון כדי לטעון את כל המשקולות. למרות שהוא מפעיל מעט פרמטרים בחישוב, כל שמונת המיליארדים חייבים לשבת בזיכרון הווידאו.

מריצים אותו עם ספריית transformers או vLLM, שמומלצת על ידי המפתחים. שימו לב שבשלב זה מנוע SGLang הרגיל לא תומך בו ישירות בגלל מבנה השכבות שלו, אלא אם משתמשים בגרסת קוד ספציפית שצוינה בכרטיס.

from transformers import pipeline

pipe = pipeline("text-generation", model="ATH-MaaS/Marco-Nano-Instruct")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה במוצרים סגורים. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים או הגבלות שימוש נוספות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗