GPT
N

NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

קוד פתוח

nvidiaother2026-06-03

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ענק עם 550 מיליארד פרמטרים שמשתמש בכימות של ארבעה ביט כדי לפעול ביעילות על חומרה חזקה. הוא מיועד למי שצריך יכולות הסקה עמוקות וסוכנים אוטונומיים בלי לשלם על הפעלת כל המשקלים בכל טוקן.

  • 303Bפרמטרים
  • 262,144טוקנים בהקשר
  • 328 GBמשקל הקבצים
  • 354,697הורדות בחודש

מה זה

מדובר במודל היברידי שמשלב שכבות Mamba-2, מנגנון Mixture of Experts וקשב רגיל. מתוך 550 מיליארד פרמטרים, רק 55 מיליארד פעילים בכל רגע נתון, מה שמאפשר לו להחזיק נפח ידע עצום בלי לחנוק את החישוב לחלוטין. הוא תומך בהקשר של עד מיליון טוקנים, מגיע עם מנגנון מובנה לחיזוי מספר טוקנים קדימה כדי להאיץ את הפליטה, ומאפשר להדליק או לכבות את שרשרת המחשבה שלו לפי צורך.

התוצאות במבחנים מראות שהמעבר לכימות NVFP4 כמעט לא שחק את הביצועים מול גרסת הדיוק המלא. במבחני סוכנים כמו SWE-Bench Verified הוא מחזיק 69.5 אחוז מול 70.7 במקור, ובמבחן שאלות מומחים GPQA הוא מגיע ל־87.9 אחוז ללא כלים חיצוניים. המשמעות היא שאתם מקבלים רמת דיוק של מודל קצה עליון תוך חיסכון משמעותי במשאבי זיכרון בזמן ריצה.

מתאים ל

  • פיתוח סוכני קוד מורכבים

    תוצאה של 69.5 אחוז במבחן SWE-Bench מאפשרת לו לנתח מאגרי תוכנה גדולים ולתקן באגים אוטונומית.

  • תחקור מסמכים ארוכים

    תמיכה בחלון הקשר של עד מיליון טוקנים עם ציון של 94 אחוז ב־RULER הופכת אותו למתאים לקריאת ספריות שלמות.

  • אוטומציה של תהליכי שירות

    ביצועים גבוהים של מעל 88 אחוז במבחני קמעונאות ותקשורת של TauBench מתאימים לניתוב וניהול פניות.

איפה זה נופל

הנפילה הגדולה של המודל נחשפת במשימות מסוימות. בבדיקת הבנקאות של TauBench V3 הוא צונח ל־19.2 אחוז בלבד, ציון נמוך מאוד שמחייב זהירות קיצונית לפני שמשלבים אותו במערכות פיננסיות. בנוסף, במבחני מדע קשים כמו CritPt ללא כלים הוא נעצר על 3.4 אחוז, ובמבחן OmniScience הוא עומד על 24.6 אחוזי דיוק בלבד עם 75.5 אחוז מניעת הזיות. נקודה קריטית למשתמש הישראלי היא השפות. עברית אינה מופיעה ברשימת השפות הנתמכות על ידי היצרן, כך שלא כדאי לבנות עליו לעיבוד מסמכים או שיחה בעברית ללא בדיקה מעמיקה מראש.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

המודל לא הוכשר רשמית על עברית. רשימת השפות כוללת אנגלית, צרפתית, ספרדית, איטלקית, גרמנית, יפנית, קוריאנית, הינדי, פורטוגזית וסינית. הוא עשוי לפלוט עברית מסוימת, אבל ללא תמיכה מובטחת לא הייתי מסתמך עליו למשימות מקומיות.

כמה כוח מחשוב נחוץ רק בשביל להפעיל אותו?

הדרישה המינימלית היא שרת בודד עם ארבעה מאיצי B200, או לחלופין שמונה מאיצי H100. קבצי המודל תופסים 328 גיגה בייט בארבעה ביט, כך שכרטיסים ביתיים או שרתים קטנים לא באים בחשבון כלל.

איך אפשר לשלוט על מהירות התגובה ושרשרת המחשבה שלו?

המודל כולל מנגנון חשיבה שניתן להפעיל או לכבות ישירות בתבנית השיחה באמצעות דגל ייעודי. בנוסף, הוא מאומן לחזות כמה טוקנים ברצף כדי לייצר פלט בקצב גבוה יותר מהרגיל.

איך מריצים

אין פה קיצורי דרך. המשקל הכולל של הקבצים עומד על 328 גיגה בייט, וכדי להריץ אותו מקומית דרוש שרת עם לפחות ארבעה כרטיסי B200, או פריסה של שמונה כרטיסי H100. תמיכת התוכנה מבוססת על מנועים מודרניים כמו SGLang, vLLM או TensorRT-LLM, עם שימוש ייעודי ב־Ray עבור תצורות מרובות שרתים.

אם אין לכם אשכול מחשוב פרטי מהשורה הראשונה, אל תנסו להרים אותו לבד. צריכת החשמל, עלות החומרה והמורכבות של ניהול זיכרון בכימות כזה הופכים הרצה מקומית ללא כלכלית עבור רוב הצוותים, ועדיף לגשת אליו דרך נקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4")
print(pipe("שלום"))

הקבצים

243 קבצים במאגר, 328 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש במודל כפוף לרישיון OpenMDW בגרסה 1.1, והחברה מצהירה שהוא מותר לשימוש מסחרי ובלתי מסחרי. עם זאת, מכיוון שלא מדובר ברישיון קוד פתוח סטנדרטי מסוג MIT או Apache, חובה לעבור על סעיפי החוזה המלאים לפני שמשלבים אותו במוצר שמפיצים ללקוחות.

הרישיון המלא בעמוד המודל ↗