GPT
N

NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4

קוד פתוח

nvidiaother2026-03-10

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ענק עם ארכיטקטורה היברידית של Mamba-2 ותערובת מומחים, שמפעיל רק 12 מיליארד פרמטרים בכל טוקן. הוא מכוון לעבודה מאומצת על כמויות גדולות של פניות אוטומטיות, סוכנים אוטונומיים והקשרים ארוכים במיוחד.

  • 67Bפרמטרים
  • 262,144טוקנים בהקשר
  • 74.8 GBמשקל הקבצים
  • 725,565הורדות בחודש

מה זה

הארכיטקטורה כאן חריגה בנוף. היא משלבת שכבות Mamba-2 עם שכבות תשומת לב ותערובת מומחים סמויה, שבה הטוקנים נדחסים לממד ייצוג קטן יותר לפני הניתוב. מתוך 120 מיליארד פרמטרים בסך הכול, רק 12 מיליארד פעילים בכל רגע נתון. המבנה הזה, לצד חיזוי רב-טוקנים מובנה, מיועד לחסוך זיכרון ולייצר פלט מהר בהרבה ממודלים צפופים בגודל דומה.

במדדי ההסקה הוא מציג מספרים חזקים, למשל 79.42 בבחינת GPQA ללא כלים וציון של 95.36 במבחן HMMT עם כלים. בבדיקות הקשר ארוך בשיטת RULER על חצי מיליון טוקנים הוא שומר על דיוק של 96.23. המשמעות היא שהמעבר לכימות NVFP4 כמעט לא שחק את הביצועים מול גרסת הבסיס, והוא שולף מידע בצורה אמינה מאוד מתוך מסמכים עצומים.

מתאים ל

  • טיפול אוטומטי בכרטיסי תמיכה

    12 מיליארד פרמטרים פעילים מאפשרים לבלוע עשרות אלפי פניות ביום בעלות חישוב נמוכה ודיוק גבוה.

  • שליפת מידע ממסמכים ארוכים

    הוא מחזיק חלון הקשר עצום ושומר על דיוק של מעל 96 אחוזים גם בעומק של חצי מיליון טוקנים.

  • סוכני שירות לקוחות מרובי צעדים

    תוצאות יציבות במבחני TauBench מראות יכולת עקבית לנהל שיחות ארוכות ולבצע פעולות עסקיות מוגדרות מראש.

איפה זה נופל

הנתונים במדדי התכנות וההפעלה הסוכנית מראים חולשה בולטת במשימות מורכבות. במבחן Terminal Bench ברמת הקושי הגבוהה הוא פותר רק 24.48 מהמקרים, ובמבחן HLE הקשה הוא נעצר על 17.42 בלבד. בפתרון משימות קוד ב־SciCode הוא מגיע לקצת פחות מ־41 אחוזי הצלחה.

המשמעות היא שהוא יתקשה מאוד לתפקד כסוכן עצמאי במערכות תפעול מורכבות או בכתיבת קוד מדעי ללא פיקוח. בנוסף, הוא לא תומך רשמית בעברית, כך שכל עבודה מול שוק מקומי תדרוש בדיקה מחמירה של פלט משובש או אובדן דיוק בהוראות מורכבות.

שאלות
נפוצות

אפשר להריץ את המודל על שרת עם שמונה כרטיסי A100 או H100?

לא. הכימות של המודל בנוי בפורמט NVFP4 ודורש מאיצים מארכיטקטורת Blackwell, כמו כרטיס B200 או מערכת DGX Spark. כרטיסים מדורות קודמים אינם נתמכים עבור הגרסה הזו.

האם הוא מתאים ליישומים בעברית?

המודל מאומן ותומך רשמית רק באנגלית, צרפתית, גרמנית, איטלקית, יפנית, ספרדית וסינית. הוא כנראה יזהה עברית ברמה מסוימת, אבל ללא תמיכה רשמית ומדידה מדויקת צפויות הזיות וקטיעות תחביר בהוראות מורכבות.

איך מריצים

אי אפשר להריץ את המשקלים האלה על כרטיס ביתי או על שרתי ענן ישנים. החומרה הנתמכת היא ארכיטקטורת Blackwell של אנבידיה בלבד, כשהמינימום הנדרש להרצה עצמאית הוא מאיץ B200 בודד או מערכת DGX Spark. המשקלים דחוסים בפורמט NVFP4 ותופסים כמעט 75 ג'יגה בייט בזיכרון ה־VRAM.

מערכות ההרצה הנתמכות בלינוקס כוללות שרת vLLM, SGLang או TensorRT-LLM, ויש צורך בקובץ מפענח ייעודי לצד הגדרות קבועות של טמפרטורה 1.0. אם אין לכם גישה לשרת ייעודי מהדור החדש, אין טעם לנסות להרים את זה לבד. במקרה כזה עדיף לקרוא למודל דרך ענן או שירות שמציע מכולת NIM מוכנה מראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון הוא מסחרי תחת הסכם NVIDIA Nemotron Open Model License. אפשר לשלב אותו במוצרים מסחריים ובמערכות פנימיות, אך שימוש במכולות NIM של החברה דורש כפיפות להסכם התוכנה הארגוני של אנבידיה. חשוב לקרוא את תנאי הרישיון המדויקים לפני הפצה בקוד פתוח או הנגשה כשירות חיצוני.

הרישיון המלא בעמוד המודל ↗