GPT
N

NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16

קוד פתוח

nvidiaother2026-06-03

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שילוב של ארכיטקטורת Mamba-2 עם MoE שמפעיל 55 מיליארד פרמטרים מתוך 550 בזמן אמת. מיועד למשימות חשיבה מורכבות, ניתוח קבצים ענקיים וסוכני אוטונומיה.

  • 561Bפרמטרים
  • 262,144טוקנים בהקשר
  • 1.0 TBמשקל הקבצים
  • 222,886הורדות בחודש

מה זה

המודל הזה משתמש בארכיטקטורת LatentMoE היברידית עם שכבות חיזוי של כמה טוקנים במקביל. בפועל הוא מריץ 55 מיליארד פרמטרים פעילים מתוך 561 מיליארד בסך הכל, מה שחוסך משאבי חישוב פר טוקן. התשובות שלו מגיעות עם שלב חשיבה מובנה, ואפשר להדליק או לכבות אותו דרך תבנית השיחה לפי הצורך.

במדדי ביצועים הוא עומד בחזית המודלים הגדולים, עם 89.0 ב־LiveCodeBench וציון 87.0 ב־GPQA ללא כלים חיצוניים. עם זאת, הוא מפגר אחרי מודלים מתחרים במשימות קוד מורכבות של SWE-Bench Verified שבהן קיבל 70.7, מול יותר מ־75 אצל המתחרים. הדגש העיקרי כאן הוא דיוק עובדתי, כאשר במדד OmniScience Non-Hallucination הוא השיג 78.7 לעומת תוצאות חד־ספרתיות במודלים אחרים באותה השוואה.

מתאים ל

  • סוכני אוטונומיה ומערכות RAG

    מסלול החשיבה המובנה ויכולת עבודה ממושכת מול כלים מתאימים לפתרון תקלות מרובות שלבים.

  • ניתוח מסמכים באורך עצום

    חלון הקשר של עד מיליון טוקנים מאפשר הזנת ספריות קוד שלמות ומסדי נתונים רחבים בבקשה אחת.

  • חישובים מדעיים ומתמטיקה

    משיג 92.3 במבחן IMOAnswerBench בשימוש בכלים, ומתאים לפתרון בעיות שדורשות דיוק מתמטי גבוה.

איפה זה נופל

במשימות סוכן של תכנות בעולם האמיתי כמו SWE-Bench, המודל מפגר באופן ברור אחרי שאר הדגמים המובילים. בבדיקות גלישה ברשת כמו BrowseComp הוא הגיע ל־44.4 בלבד, והתוצאות שלו בבנקאות במדד TauBench נמוכות ועומדות על 22.6. נוסף על כך, תמיכת TensorRT-LLM מוגבלת כרגע לארכיטקטורת Blackwell בלבד וטרם זמינה לכרטיסי Hopper. למרות שתגית המטא כוללת עברית, רשימת השפות הנתמכות בתיעוד הרשמי כוללת שפות נבחרות בלבד, כך שיש לבדוק את איכות הפלט בעברית לפני כל שימוש.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־BF16 על שרת עם שמונה כרטיסי H100?

לא בצומת יחיד. הנפח הכולל של המשקלים הוא טרה־בייט, כך שצריך לפחות 16 כרטיסי H100 במערך מבוזר עם Ray כדי לארח את המודל ואת שכבת הזיכרון. לחלופין נדרשים שמונה מאיצי H200 או שמונה כרטיסי B200.

איך משתמשים ביכולות הכלים יחד עם שלב החשיבה?

בעת שליחת קריאה לנקודת הקצה של vLLM או SGLang עם רשימת כלים, חובה להגדיר בפרמטרי התבנית enable_thinking ו־force_nonempty_content כערכי אמת כדי שהפלט יפוענח כראוי.

איך מריצים

המשקל הכולל של הקבצים מגיע לטרה־בייט שלם ב־BF16, ולכן דרישות החומרה קיצוניות. להרצה בצומת יחיד תצטרכו שמונה מאיצי B200 עם זיכרון כולל של כ־1.5 טרה־בייט כדי להחזיק את המשקלים ואת זיכרון ה־KV. בסביבה מבוזרת עם Ray צריך לפחות שמונה כרטיסי H200 או 16 כרטיסי H100.

אם אין לכם אשכול שרתים ייעודי כזה בחוות שרתים, אין שום היתכנות להריץ אותו לבד ועדיף להשתמש ב־API מנוהל. אפשרות מקומית קלה יותר היא גרסת ה־NVFP4 המכווצת של אותו מודל, שמקטינה משמעותית את נפח הזיכרון הנדרש.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16")
print(pipe("שלום"))

הקבצים

241 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש במודל כפוף לרישיון OpenMDW גרסה 1.1 המותאם של אנבידיה. הרישיון מאפשר שימוש מסחרי ולא מסחרי, אך הוא אינו רישיון קוד פתוח סטנדרטי כמו אפאצ'י. חברות שרוצות להטמיע אותו במוצר צריכות לבדוק את תנאי המסמך המקורי, במיוחד סביב הפצה והגבלות שימוש של היצרן.

הרישיון המלא בעמוד המודל ↗