GPT
N

NVIDIA-Nemotron-3-Super-120B-A12B-BF16

קוד פתוח

nvidiaother2026-03-10

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שילוב היברידי של מנגנון Mamba-2 עם שכבות MoE שמפעיל רק 12 מיליארד פרמטרים בכל טוקן מתוך 120 מיליארד. מיועד לסוכנים אוטונומיים והקשרים ארוכים במיוחד של עד מיליון טוקנים.

  • 124Bפרמטרים
  • 262,144טוקנים בהקשר
  • 230 GBמשקל הקבצים
  • 1,188,842הורדות בחודש

מה זה

אנבידיה בנתה פה שילוב יוצא דופן של שכבות Mamba-2, מומחים וקשב רגיל, שנקרא LatentMoE, יחד עם שכבות Multi-Token Prediction להאצת יצירת הטקסט. הרעיון המרכזי הוא לנצל את הקיבולת של מודל ענק עם עלות חישוב של מודל קטן בהרבה, בזכות הפעלת 12 מיליארד פרמטרים בלבד בזמן אמת. המודל מייצר כברירת מחדל נתיב חשיבה מעמיק לפני התשובה, אך ניתן לכבות את המנגנון או להגביל אותו במפורש.

במדדי ההסקה המודל מציג עוצמה מרשימה, עם ציון של 90.21 בבחינת המתמטיקה AIME25 ללא כלים ו־94.73 ב־HMMT כשהוא משתמש בכלים. עם זאת, במבחני תכנות מורכבים כמו SWE-Bench בסביבת OpenHands הוא מגיע ל־60.47, תוצאה סבירה אך נמוכה ממתחרה ישיר כמו Qwen3.5-122B שמגיע ל־66.40. החוזק הבולט הוא שימור מידע בהקשרים עצומים, שם הוא מחזיק ציון של 91.75 במבחן RULER גם בעומק של מיליון טוקנים.

מתאים ל

  • עיבוד מסמכי ענק ב־RAG

    חלון הקשר של עד מיליון טוקנים עם דיוק גבוה במבחני שליפה מאפשר לנתח ספריות קוד או מאגרי דוחות שלמים.

  • אוטומציה של פניות תמיכה

    ארכיטקטורת מומחים עם 12B פרמטרים פעילים מספקת מענה מהיר וחסכוני בנפחי תעבורה כבדים של קריאות שירות.

  • פתרון בעיות מתמטיות

    מנגנון חשיבה פנימי מובנה מביא לתוצאה של 90.21 ב־AIME25, מעולה לניתוח לוגי מורכב שדורש שלבי ביניים.

איפה זה נופל

הנקודה החלשה ביותר היא משימות חקירה ומענה לשאלות מומחים ברמת דוקטורט. במבחן HLE המודל משיג 18.26 בלבד ללא כלים, לעומת 25.30 שמציג המתחרה של Qwen. גם במבחן TauBench במגזר הטלקום הוא מפגר משמעותית עם ציון של 64.36 לעומת 95.00 אצל המתחרה. בנוסף, המודל אינו תומך בעברית, כך שלא ניתן לבנות עליו למוצרים הפונים ישירות לקהל מקומי.

אותה משפחה

NVIDIA-Nemotron-3-Super יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים למוצר בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, צרפתית, גרמנית, איטלקית, יפנית, ספרדית וסינית בלבד. הוא לא אומן ולא נבדק על עברית, ואין לצפות ממנו להבנה תקינה של השפה.

איך אפשר לשלוט בכמות הטוקנים שהוא מבזבז על חשיבה?

אפשר לכבות את מצב החשיבה לחלוטין דרך תבנית הצ'אט בעזרת הפרמטר enable_thinking שמוגדר ל־False. בנוסף קיים מצב low_effort שמקצר את שלבי ההסקה, או שניתן להגדיר תקציב טוקנים קשיח לחשיבה באמצעות סקריפט הלקוח.

איך מריצים

המשקל של הקבצים מגיע ל־230 גיגה בייט בפורמט BF16, מה שמציב רף כניסה תובעני מאוד. כדי להרים אותו בבית או בענן צריך לפחות 8 כרטיסי H100 של 80 גיגה, או לחלופין שני כרטיסי Blackwell דוגמת B200 או B300 בזכות נפח הזיכרון הגדול שלהם. אפשר להריץ אותו דרך vLLM, SGLang או TensorRT-LLM עם טעינת קוד מרוחק ופרסר ייעודי לשרשראות החשיבה.

אם אין לכם קלאסטר כזה בהישג יד, עדיף לקרוא לו ישירות דרך נקודת קצה בענן של אנבידיה. למי שמחפש חומרה צנועה יותר קיים גם צ'קפוינט מקוונטט של NVFP4 שמסוגל לרוץ על כרטיס B200 בודד.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16")
print(pipe("שלום"))

הקבצים

75 קבצים במאגר, 230 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל כפוף לרישיון מותאם אישית של אנבידיה בשם NVIDIA Nemotron Open Model License. החברה מצהירה שהמשקולות פתוחות ומוכנות לשימוש מסחרי, אך שימוש במכולות NIM דורש הסכמה להסכמי רישוי תוכנה נפרדים של אנבידיה, ולכן חובה לקרוא את התנאים המשפטיים לפני הטמעה במערכת ייצור.

הרישיון המלא בעמוד המודל ↗