GPT
N

Nemotron-Cascade-2-30B-A3B

קוד פתוח

nvidiaother2026-03-18

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זהו מודל תערובת מומחים של אנבידיה שמפעיל רק 3 מיליארד פרמטרים מתוך 32 מיליארד. הוא מיועד לפתרון בעיות קוד ומתמטיקה קשות במיוחד בלי לשלם בזמן ריצה כבד.

  • 32Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.8 GBמשקל הקבצים
  • 37,417הורדות בחודש

מה זה

מדובר במודל MoE שמחזיק משקל כולל של כמעט 32 מיליארד פרמטרים, אבל מנתב כל טוקן כך שרק 3 מיליארד פעילים בפועל. הוא אומן מעל מודל הבסיס Nemotron-3-Nano-30B-A3B ותומך בשני מצבים, מצב מחשבה עם תגיות ייעודיות ומצב מענה ישיר. לפי המדידות של אנבידיה הוא מגיע לתוצאות גבוהות מאוד בתחרויות מתמטיקה ומבחני קוד מורכבים, כולל 35 נקודות ב־IMO 2025 וציון של 87.2 ב־LiveCodeBench v6, מעל מודלים מתחרים בגדלים דומים.

השילוב של ארכיטקטורת היברידית עם Mamba מביא מהירות הסקת מסקנות של מודל 3B קטן, יחד עם קיבולת ידע של מודל 30B. במבחני הבנה כללית הוא מתקשה יותר, אבל בחישובי לוגיקה טהורה ופיתוח אלגוריתמי הוא בולט מול המתחרים בקטגוריית המשקל שלו.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    מצטיין במתמטיקה תחרותית וחישובי לוגיקה תכנותיים מורכבים תחת מצב חשיבה.

  • ניתוח מסמכים ארוכים באנגלית

    מנצל חלון של מעל 260 אלף טוקנים לאיתור מידע ובדיקת קבצים גדולים באנגלית.

  • סביבות OpenHands

    מתוכנן להתממשק עם OpenHands למשימות תכנות ותיקון באגים בסביבה מבוקרת.

איפה זה נופל

במבחני ידע כללי, הבנה מדעית רחבה וסוכנים אוטונומיים הוא מציג חולשה ברורה. ב־GPQA Diamond הוא מקבל 76.1 לעומת 84.2 של Qwen3.5-35B-A3B, וב־SWE Verified הוא מגיע ל־50.2 בלבד מול 69.2 של אותו מתחרה. המודל גם הוגדר רשמית לאנגלית בלבד, כך שלא הייתי בונה עליו לשום עיבוד בעברית. נוסף לכך, הכרטיס מציין תמיכה בעיקר ב־OpenHands ומבהיר כי אין תמיכה ב־OpenCode.

שאלות
נפוצות

כמה זיכרון כרטיס מסך נדרש כדי להריץ את המודל?

המשקלים תופסים קרוב ל־59 גיגהבייט לפני חישובי זיכרון הקשר. כדי להריץ אותו דרך vLLM בביצועים יציבים תצטרכו כרטיס יחיד של 80 גיגהבייט או שני כרטיסים של 48 גיגהבייט.

האם המודל מתאים לשימוש בעברית?

התיעוד הרשמי מגדיר אנגלית בלבד. המודל לא עבר התאמה ייעודית לשפות אחרות ובמבחני תרגום רב-לשוניים הוא מציג ירידה בביצועים, לכן לא מומלץ להסתמך עליו לפרויקטים בעברית.

איך מריצים

המשקלים מגיעים בפורמט bfloat16 ושוקלים כ־58.8 גיגהבייט. כדי לטעון אותו לזיכרון בלי קוונטיזציה תצטרכו כרטיס עם לפחות 80 גיגהבייט זיכרון וידאו, כמו A100 או H100, במיוחד אם תרצו לנצל את חלון ההקשר הגדול שמגיע עד 262,144 טוקנים בהרצה המומלצת. ההרצה נעשית דרך vLLM מגרסה 0.17.1 ומעלה, ומחייבת שימוש בדגלים ייעודיים לתמיכה בשכבות Mamba ובפרסר התשובות nano_v3.

אם אין לכם שרת ייעודי בענן עם כרטיס תואם, אין טעם לנסות להרים אותו על מחשב מקומי. במצב כזה עדיף לצרוך אותו ישירות דרך נקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Cascade-2-30B-A3B")
print(pipe("שלום"))

הקבצים

54 קבצים במאגר, 58.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License ולא לרישיון קוד פתוח סטנדרטי כמו אפאצ׳י או MIT. הרישיון מאפשר שימוש מסחרי, אך כולל מגבלות ותנאים משפטיים מוגדרים של אנבידיה שחובה לקרוא היטב לפני שילוב שלו במוצר סגור.

הרישיון המלא בעמוד המודל ↗