GPT
N

NVIDIA-Nemotron-3-Super-120B-A12B-GGUF

קוד פתוח

unslothother2026-03-06

  • gguf
  • nvidia
  • pytorch
  • nemotron-3
  • latent-moe

גרסת קוונטיזציה של מודל ענק שמשלב ארכיטקטורת Mamba-2 עם מומחים, ומפעיל רק 12 מיליארד פרמטרים בכל שלב. הוא נותן חשיבה עמוקה והקשר של מיליון טוקנים בלי מחיר החישוב של מודל מלא.

  • 1.8 TBמשקל הקבצים
  • 10,940הורדות בחודש
  • 152לייקים

מה זה

הארכיטקטורה כאן חריגה בנוף. במקום להריץ את כל 120 מיליארד הפרמטרים בכל טוקן, המבנה ההיברידי מנתב את המידע דרך שכבות Mamba-2 ומומחים ברמת LatentMoE, כך שבפועל רצים 12 מיליארד בלבד. השילוב הזה נותן מהירות יצירה גבוהה בזכות חיזוי מרובה טוקנים ומאפשר לטפל בחלון הקשר עצום של עד מיליון טוקנים, בלי להתרסק בעלויות זיכרון של מנגנון Attention מלא.

במבחני ביצועים התוצאות משקפות מנוע חזק במתמטיקה ולוגיקה עם 90.21 בבנצ'מרק AIME25 וציון 93.67 במבחן HMMT, שניהם ללא כלים חיצוניים. המודל שומר על יציבות מרשימה בהקשר ארוך עם תוצאה של 91.75 בבדיקת RULER למיליון טוקנים, מה שהופך אותו לרלוונטי מאוד לקריאת מאגרי מסמכים שלמים ולסוכני אוטומציה מורכבים.

מתאים ל

  • פתרון בעיות מתמטיות קשות

    משיג תוצאה של 90.21 בבנצ'מרק AIME25 ללא שימוש בכלים חיצוניים בזכות מנגנון חשיבה מובנה.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר של עד מיליון טוקנים עם ציון 91.75 במבחן RULER לטקסטים בהיקף מלא.

  • אוטומציית כרטיסי תמיכה ו־IT

    מיועד ספציפית לטיפול בנפחי עבודה גבוהים דרך שילוב 12 מיליארד פרמטרים פעילים שמאיצים את הפלט.

איפה זה נופל

הנתונים מראים נפילה ברורה בכל מה שקשור למשימות תוכנה וסוכנים רב-שלביים מול מתחרים בקטגוריית הגודל שלו. במבחן SWE-Bench עם סביבת OpenHands הוא נעצר בתוצאה של 60.47, לעומת 66.40 של Qwen3.5-122B. במבחן TauBench בתחום הטלקום הוא השיג 64.36 בלבד, מול 95.00 של אותו מתחרה. בעיה מהותית נוספת מול הקהל המקומי היא היעדר תמיכה רשמית בעברית, כאשר המודל אומן ותועד עבור אנגלית, צרפתית, גרמנית, איטלקית, יפנית, ספרדית וסינית בלבד.

שאלות
נפוצות

איך שולטים במצב החשיבה של המודל בזמן קריאה?

השליטה מתבצעת דרך הגדרות הפורמט של השיחה. שולחים את המשתנה enable_thinking כערך אמת או שקר, ואפשר גם להפעיל מצב low_effort כדי לצמצם את כמות טוקני ההסקה ולחסוך זמן יצירה.

למה צריך לשים לב בהגדרות הדגימה של המודל?

התיעוד קובע באופן גורף שיש לעבוד עם טמפרטורה 1.0 וערך Top-P של 0.95 עבור כל סוגי הפעולות. שינוי מהערכים האלה פוגע בביצועי ההסקה, קריאות הכלים והשיחה החופשית.

איך מריצים

למרות שמדובר בגרסת GGUF מכווצת, המאגר כולל 80 קבצים בנפח כולל של 1.8 טרה בייט עבור רמות הדיוק השונות. כדי להריץ את הגרסאות המלאות יותר של הארכיטקטורה הזו צריך מערך שרתים כבד, כשגרסת המקור של אנבידיה דורשת שמונה כרטיסי H100 של 80 גיגה, או כרטיסי Blackwell בודדים לפורמט הדחוס.

מריצים אותו דרך ספריות כמו vLLM, SGLang או TensorRT-LLM, עם דגש קריטי על הגדרת הטמפרטורה לערך 1.0 וערך Top-P של 0.95 לכל סוגי המשימות. אם אין לכם גישה לחוות שרתים מקומית של כמה כרטיסים ארגוניים במקביל, כדאי לשקול קריאה לנקודת קצה מנוהלת במקום להשקיע אלפי דולרים בחודש בתשתית ענן ייעודית.

ollama run hf.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

80 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר תחת תנאי NVIDIA Nemotron Open Model License ומתיר שימוש מסחרי, אך כפוף להסכמי השימוש הספציפיים של אנבידיה לתוכנות ארגוניות ומוצרי בינה מלאכותית. זה אומר שאפשר להטמיע אותו במוצרים מסחריים, אבל חובה לעיין בחוזה המקורי של החברה כדי לוודא שפעילות המוצר אינה מפרה סעיפי הגבלה תאגידיים.

הרישיון המלא בעמוד המודל ↗