GPT
N

NVIDIA-Nemotron-3-Nano-30B-A3B-NVFP4

קוד פתוח

nvidiaother2025-12-20

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל היברידי שמשלב שכבות Mamba עם מומחים, ומפעיל רק 3.5 מיליארד פרמטרים בפועל. הוא נועד למי שצריך יכולות חשיבה וסוכנים בלי לשלם את מחיר המהירות של מודל ענק.

  • 18Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 496,778הורדות בחודש

מה זה

הארכיטקטורה כאן חריגה בנוף. יש בו 23 שכבות Mamba-2, עוד 23 שכבות תערובת מומחים ורק 6 שכבות תשומת לב רגילות. מתוך 30 מיליארד פרמטרים כוללים, כל טוקן מפעיל רק 3.5 מיליארד דרך שישה מומחים מנותבים ועוד אחד קבוע. השילוב הזה שומר על מהירות גבוהה ומאפשר חלון הקשר ענק שמגיע תיאורטית עד מיליון טוקנים, כשברירת המחדל עומדת על 256 אלף.

המודל מגיע מכווץ בפורמט NVFP4 עם זיכרון הקשר בפורמט FP8. המדידות מראות שהכיווץ הזה כמעט לא פוגע ביכולת החשיבה, עם 86.7 במבחן המתמטי AIME25 לעומת 89.1 בגרסת המקור הלא מכווצת. עם זאת, בבדיקות של סוכנים אוטונומיים נרשמת שחיקה מורגשת יותר, למשל ירידה מ־48 ל־41.5 במשימות תעופה של TauBench V2.

מתאים ל

  • סוכני שירות וקריאות לכלים

    התמחות ייעודית ב־tool calling וגמישות מובנית לשליטה בתקציב טוקני החשיבה לפי זמני תגובה.

  • פתרון בעיות קוד וחשבון

    תוצאות חזקות במבחני AIME25 ו־LiveCodeBench ביחס למודל שמפעיל רק 3.5 מיליארד פרמטרים.

  • ניתוח מסמכים ארוכים באנגלית

    חלון עבודה בסיסי של 256k טוקנים שמאפשר עיבוד תכנים נרחבים בלי לפצל אותם מראש.

איפה זה נופל

החיסרון הבולט ביותר לקורא המקומי הוא השפות. רשימת השפות הנתמכות כוללת אנגלית, גרמנית, ספרדית, צרפתית, איטלקית ויפנית בלבד, כך שעברית כלל לא נתמכת רשמית. בנוסף, המבחן להקשרים ארוכים AA-LCR מציג ציון חלש למדי של 33.3 בלבד, מה שמלמד שההבנה במסמכים ענקיים לא תמיד יציבה. מבחן HLE למשימות מדעיות מורכבות נעצר על 9.4 נקודות, כך שלא כדאי לבנות עליו לפרויקטים מחקריים כבדים.

שאלות
נפוצות

האם חייבים לחכות לשרשרת החשיבה בכל שאלה?

לא. המודל מאפשר לכבות את החשיבה הפנימית דרך פרמטר בטמפלייט של הצ'אט. כיבוי המנגנון מקצר משמעותית את זמן התגובה, אבל בכרטיס המודל מצוין שבמשימות מורכבות זה מוביל לירידה מסוימת בדיוק.

איך שולטים על משך הזמן שהמודל חושב?

אפשר להגדיר תקציב טוקנים לחשיבה דרך הלקוח. המערכת מנסה לחתוך את שלב החשיבה בירידת השורה הראשונה שלאחר הגבול, או קוטעת אותו לחלוטין אם חורגים ב־500 טוקנים נוספים.

איך מריצים

בזכות הדחיסה ל־NVFP4 כל המשקלים יושבים ב־18 גיגה־בייט. אפשר לטעון אותו על כרטיס יחיד עם זיכרון נדיב, והכרטיס הרשמי מציין תמיכה בחומרת שרתים כמו NVIDIA H100 או A100 תחת לינוקס. אפשר להרים אותו ישירות בספריות כמו vLLM, SGLang או TensorRT-LLM עם שימוש בפרסר ייעודי לשרשראות חשיבה.

אם יש לכם כרטיס תואם בענן, ההרצה העצמית פשוטה יחסית ולא דורשת חלוקה לכמה מעבדים גרפיים. מצד שני, אם אין לכם גישה למעבדי NVIDIA מהסדרות האלה או שהתשתית שלכם מבוססת על חומרה צרכנית רגילה, עדיף להשתמש בנקודת קצה מנוהלת במקום להיאבק בתאימות של פורמט ה־FP4.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-NVFP4")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון הייעודי NVIDIA Nemotron Open Model License. הוא מוגדר כמאושר לשימוש מסחרי, אך כולל תנאי שימוש משפטיים ספציפיים של אנבידיה שאינם זהים לרישיונות קוד פתוח מוכרים. מי שמתכנן לשלב אותו במוצר מסחרי נדרש לעיין בהסכם הרישיון המלא של החברה ולוודא שהשימוש עומד במגבלות ההפצה וההטמעה שלהם.

הרישיון המלא בעמוד המודל ↗