GPT
N

NVIDIA-Nemotron-3-Super-120B-A12B-FP8

קוד פתוח

nvidiaother2026-03-10

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

היבריד של מומחים וארכיטקטורת מאמבה שמפעיל 12 מיליארד פרמטרים מתוך 120 בכל צעד. הוא מיועד למי שצריך חשיבה מעמיקה וסוכנים אוטונומיים בלי לשלם עלויות הסקה של מודל ענק.

  • 124Bפרמטרים
  • 262,144טוקנים בהקשר
  • 120 GBמשקל הקבצים
  • 103,208הורדות בחודש

מה זה

מדובר במודל שמשלב שכבות Mamba-2 עם תערובת מומחים ושכבות תשומת לב בודדות, בתוספת מנגנון לחיזוי מספר טוקנים קדימה בכל צעד. למרות שיש לו 124 מיליארד פרמטרים בזיכרון, רק 12 מיליארד פעילים בכל רגע נתון. המבנה הזה נותן מהירות תגובה גבוהה בהרבה ממודלים מלאים בגודל דומה, יחד עם יכולת להחזיק הקשר ארוך של עד מיליון טוקנים, כאשר ברירת המחדל עומדת על 262,144.

במדדי ביצועים המודל מציג תוצאות מעניינות. במבחני הגיון מורכבים כמו HMMT עם כלים הוא מגיע לציון 94.38 בגרסת FP8, ובמבחן LiveCodeBench הוא עומד על 78.44. גם במבחן RULER שמודד שליפה מתוך הקשר של 512 אלף טוקנים הוא שומר על 95.66. היתרון כאן הוא שאין כמעט פגיעה בביצועים במעבר לדיוק נמוך, מה שמשאיר אותו מדויק גם כשהוא דחוס.

מתאים ל

  • אוטומציה של פניות תמיכה

    מתאים לטיפול בנפח גבוה של כרטיסי שירות באנגלית בזכות עלות הסקה נמוכה של מומחה קטן.

  • סוכנים עם זימון כלים

    מציג 94.38 במדד חשיבה עם כלים ותומך בהפעלת מצב הסקת מסקנות לפי תקציב טוקנים.

  • שליפת מידע ממסמכי ענק

    מחזיק דיוק של מעל 95 אחוז בשליפה מתוך חצי מיליון טוקנים בבדיקות RULER.

איפה זה נופל

החולשה הבולטת ביותר היא בעברית, המודל פשוט לא אומן עליה. רשימת השפות הרשמית כוללת אנגלית, צרפתית, גרמנית, איטלקית, יפנית, ספרדית וסינית בלבד. אם תפנו אליו בעברית תקבלו תוצאות שבורות או הזיות. בנוסף, במשימות טרמינל קשות הוא משיג רק 26.04 נקודות, ובמבחן מדעי כמו SciCode הוא נעצר על 41.38, כך שאי אפשר לסמוך עליו בעבודה מורכבת מול מערכות הפעלה או מדע חישובי ללא בקרה צמודה.

אותה משפחה

NVIDIA-Nemotron-3-Super יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לאפליקציה שפונה למשתמשים בישראל?

לא מומלץ בכלל. עברית אינה מופיעה ברשימת השפות הנתמכות של המודל, והוא אומן בעיקר על אנגלית ושש שפות מרכזיות נוספות. עדיף לבחור מודל רב לשוני אחר אם הממשק או המידע שלכם בעברית.

כמה זיכרון GPU באמת צריך כדי להרים אותו?

משקל הקבצים לבדו הוא 120 גיגה בייט בפורמט FP8. כדי להריץ שרת עם חלון הקשר ארוך וטעינת מומחים, תצטרכו לפחות שני כרטיסי H100 של 80 גיגה, או ארבעה כרטיסים בתצורה מקבילית של טנסורים ומומחים לפי מדריכי הפריסה.

איך מריצים

בשביל להריץ אותו מקומית בגרסת FP8 תצטרכו לפחות שני כרטיסי H100 של 80 גיגה, כפי שמצוין בדרישות המינימום, או מעבדי B200 ו־B300 שבהם הוא נכנס על כרטיס בודד. ספריות כמו vLLM ו־SGLang תומכות בו ישירות, אבל צריך להגדיר חלוקה של 4 כרטיסים במקביל עם פרלליזם למומחים, להוריד פארסר ייעודי ולעבוד עם טמפרטורה קבועה של 1.0.

אם אין לכם אשכול שרתים ייעודי בענן עם חומרה מתאימה, עדיף בהרבה להשתמש ב־API מנוהל או בקונטיינר של נימ. הרמה של שרת פרטי עם כרטיסים כאלה בשביל בדיקות ראשוניות תעלה המון כסף ותדרוש תחזוקה טכנית מורכבת של דרייברים וקונפיגורציות.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון פתוח ייעודי של אנבידיה עבור נמוטרון, שמאפשר שימוש מסחרי בחינם. מותר לשלב אותו במוצרים, להריץ אותו בארגון ולפתח עליו שירותים. אם אתם משתמשים בקונטיינר מסוג NIM, חלים עליו תנאי רישוי תוכנה נפרדים של אנבידיה שדורשים תשומת לב משפטית לפני הפצה חיצונית.

הרישיון המלא בעמוד המודל ↗