GPT
N

NVIDIA-Nemotron-3-Nano-30B-A3B-FP8

קוד פתוח

nvidiaother2025-12-06

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המודל הזה משלב ארכיטקטורת Mamba-2 עם תערובת מומחים כדי לספק חשיבה מורכבת בעלות ריצה נמוכה. הוא מפעיל רק 3.5 מיליארד פרמטרים בפועל בכל טוקן, למרות גודל כולל של 30 מיליארד.

  • 32Bפרמטרים
  • 262,144טוקנים בהקשר
  • 30.5 GBמשקל הקבצים
  • 630,325הורדות בחודש

מה זה

מדובר במודל שפותח בידי NVIDIA ומערב 23 שכבות Mamba-2, עוד 23 שכבות של תערובת מומחים, ורק 6 שכבות תשומת לב מסורתיות. המבנה הזה מאפשר לו לעבד הקשר של עד מיליון טוקנים, כאשר ברירת המחדל עומדת על 262,144 טוקנים, בלי להעמיס את הזיכרון כמו מודלי שנאי רגילים.

הוא מתוכנן לענות בעזרת תהליך חשיבה פנימי שקודם לתשובה הסופית, אבל מאפשר לכבות את התכונה הזו בהגדרות התבנית כשצריך לחסוך זמן ומשאבים. המבחנים מראים שהקוונטיזציה לפורמט FP8 כמעט ולא פגעה בדיוק, עם ציון של 87.7 במבחן AIME25 ללא עזרים לעומת 89.1 בגרסת הדיוק המלאה. במשימות הפעלת כלים וסוכנים הוא מגיע לתוצאות סבירות, אבל בבדיקות תכנות כמו SciCode הוא נעצר באזור ה־31.9 אחוז בלבד.

מתאים ל

  • סוכנים אוטונומיים

    חיבור למערכות קריאת כלים חיצוניות בזכות תמיכה מובנית בפורמט קריאות וזיכרון עבודה רחב.

  • עיבוד מסמכים ענקיים

    ניתוח טקסטים ארוכים במיוחד של מאות אלפי טוקנים תוך ניצול יעילות הארכיטקטורה ההיברידית.

  • פתרון בעיות מתמטיות

    דיוק גבוה מאוד במבחני AIME25 כאשר מאפשרים לו לייצר שרשרת חשיבה מלאה לפני התשובה.

איפה זה נופל

עברית אינה ברשימת השפות הנתמכות של המודל, שכוללת רק אנגלית, ספרדית, צרפתית, גרמנית, יפנית ואיטלקית. במבחני קידוד מדעי מורכבים כמו SciCode הוא השיג 31.9 בלבד, ובמבחן הבעיות הקשות HLE הוא נעצר סביב 10.3 אחוז ללא כלים חיצוניים. כיבוי מנגנון החשיבה הפנימית מוריד את הדיוק במשימות קשות, כך שלמשימות מהירות ללא חשיבה מוקדמת יש פשרה מורגשת בתוצאה.

אותה משפחה

NVIDIA-Nemotron-3-Nano יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

לא כדאי לבנות עליו לפרויקטים בעברית. רשימת השפות הרשמית כוללת שפות אירופיות מרכזיות ויפנית בלבד, והאימון שלו לא התמקד בטקסטים בעברית.

מה היתרון של גרסת FP8 לעומת הגרסה הרגילה?

גרסת FP8 מקטינה בחצי את נפח הזיכרון שנדרש למשקלים ומאיצה את החישוב, כאשר הפגיעה בביצועים ובמבחני הידע זניחה לעומת גרסת BF16.

אפשר לשלוט על כמות הטוקנים שהוא מקדיש לחשיבה?

כן, המודל מאפשר לקבוע תקציב חשיבה באמצעות פרמטר ייעודי, או לבטל לחלוטין את שרשרת המחשבה כדי לקבל מענה ישיר ומהיר יותר.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־30.5 גיגהבייט. NVIDIA מציינת במפורש תמיכה בארכיטקטורות A100 ו־H100 עם 80 גיגהבייט זיכרון גרפי, תחת מערכת הפעלה Linux. כדי לשרת אותו בסביבת ייצור אפשר להשתמש ב־vLLM מגרסה 0.12.0 ומעלה, ב־SGLang או ב־TRT-LLM, תוך הפעלת FlashInfer ותמיכה ב־FP8.

אם אין לכם שרת ייעודי עם כרטיס של 80 גיגהבייט פנוי לפחות, עדיף להשתמש ב־API דרך NVIDIA Build ולא להסתבך עם התקנה מקומית, בעיקר בגלל הדרישות של זיכרון ה־KV בחלונות הקשר ארוכים.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Nemotron Open Model License, שמסווג במאגר כ־other. הוא מתיר שימוש מסחרי בקוד ובמשקלים, אך מחייב בדיקה של תנאי השימוש המשפטיים של NVIDIA לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗