GPT
N

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

קוד פתוח

nvidiaother2025-12-04

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל היברידי חכם שמפעיל רק 3.5 מיליארד פרמטרים מתוך 30 בזמן אמת. הוא מציע יכולות חשיבה עמוקות, חלון ענק ותמיכה בקריאות לכלים בלי לשרוף לכם את כל כוח המחשוב בשרת.

  • 32Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.8 GBמשקל הקבצים
  • 844,882הורדות בחודש

מה זה

מדובר בארכיטקטורה לא שגרתית שמשלבת 23 שכבות Mamba-2 יחד עם Mixture-of-Experts ורק שש שכבות של Attention רגיל. למרות שיש לו יותר מ־31 מיליארד פרמטרים על הנייר, בכל טוקן פועלים רק שישה מומחים מתוך 128, כלומר כ־3.5 מיליארד פרמטרים אקטיביים בלבד. הדבר הזה מאפשר לו לייצר מהירות ריצה גבוהה מאוד יחד עם זיכרון הקשר עצום שמגיע במקור ל־256 אלף טוקנים ויכול להימתח עד למיליון.

בבנצ'מרקים של מתמטיקה וקוד הוא מציג מספרים מרשימים, כמו 99.2 ב־AIME25 ו־75.0 ב־GPQA כשמשלבים לו כלים חיצוניים, לצד 68.3 במבחן LiveCodeBench. הוא מגיע עם מנגנון מובנה ליצירת שלבי חשיבה פנימיים לפני התשובה הסופית, ואפשר לכבות את התכונה הזו בהגדרות אם אתם צריכים תגובה זריזה ומוכנים להתפשר מעט על הדיוק.

מתאים ל

  • סוכני ניתוח קוד

    תוצאה של 38.8 ב־SWE-Bench וזיהוי כלים יעיל מתאימים למשימות אוטומציה של פיתוח תוכנה.

  • פתרון בעיות מתמטיות

    השילוב של שרשרת חשיבה עם הרצת כלים מאפשר דיוק יוצא דופן של 99.2 ב־AIME25.

  • עיבוד מסמכי ענק באנגלית

    חלון הקשר של 262 אלף טוקנים שניתן להרחבה עד מיליון מאפשר לנתח ספריות קוד ומסמכים ארוכים.

איפה זה נופל

הנקודה הקריטית ביותר לקורא הישראלי היא השפה. המודל אומן ותומך רשמית באנגלית, ספרדית, צרפתית, גרמנית, יפנית ואיטלקית בלבד. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן הסתמכות עליו למשימות בעברית ללא בדיקה מוקדמת צפויה להוביל להזיות ולתוצאות שבורות.

בנוסף, במבחני ידע רב לשוניים כמו MMLU-ProX הוא הוציא ציון של 59.5, שנמוך משמעותית ממתחרים כמו Qwen3. גם בסביבות סוכן מורכבות כמו Terminal Bench הציון שלו עומד על 8.5 בלבד, מה שמראה שבלי כלים חיצוניים הוא עדיין מתקשה להתמודד עם משימות מערכת מורכבות.

אותה משפחה

NVIDIA-Nemotron-3-Nano יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו למוצר שפונה לקהל ישראלי בעברית?

לא. המודל לא כולל תמיכה מוצהרת בעברית והשפות הנתמכות בו הן אנגלית ומספר שפות אירופיות ויפנית. אם אתם צריכים ייצור תוכן או צ'אט בעברית, חפשו מודל אחר.

איך אפשר לשלוט על זמני התגובה שלו כשהוא חושב יותר מדי?

אפשר לכבות את החשיבה לחלוטין דרך הטמפלייט, או להשתמש בהגדרת reasoning budget דרך ה־API כדי להגביל את מספר הטוקנים שהוא מקדיש לחשיבה לפני שהוא מתחיל לענות.

מה היתרון של ארכיטקטורת Mamba-2 המשולבת כאן?

השילוב של שכבות Mamba עם מומחים מופעלים מאפשר לו לרוץ מהר יותר ולצרוך פחות משאבים על הקשרים ארוכים ביחס למודלי Attention רגילים בגודל 30B.

איך מריצים

כדי להרים אותו בעצמכם צריך שרת לינוקס עם חומרה חזקה. קבצי המודל עצמם שוקלים 58.8 גיגה בייט בפורמט bfloat16, כך שכרטיס כמו H100 של 80 גיגה בייט או A100 הם דרישת בסיס רק כדי להחזיק אותו בזיכרון, ועוד לא דיברנו על המקום הנדרש אם מותחים את ההקשר מעבר לברירת המחדל. הוא נתמך בספריות כמו vLLM, SGLang, NeMo ו־Transformers.

אם אין לכם קלאסטר כזה פנוי או שהפרויקט שלכם לא מצדיק הוצאה על חומרה ייעודית, עדיף להשתמש ב־API של NVIDIA דרך שירותי הענן שלהם. הרצה מקומית משתלמת רק אם יש לכם צורך מובהק בפרטיות נתונים או כוונה לבצע פניות רצופות בנפחים גבוהים מאוד שמצדיקים את עלות השרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16")
print(pipe("שלום"))

הרישיון

השימוש מוסדר תחת רישיון ייעודי בשם NVIDIA Nemotron Open Model License. כרטיס המודל מציין במפורש שהוא מוכן לשימוש מסחרי, אך כיוון שמדובר ברישיון קנייני של אנבידיה ולא ברישיון קוד פתוח סטנדרטי כמו Apache או MIT, חובה לעיין בסעיפי הרישיון המלאים באתר החברה לפני שילובו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗