GPT
N

NVIDIA-Nemotron-Nano-9B-v2

קוד פתוח

nvidiaother2025-08-12

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שפה קטן של אנבידיה שמשלב חשיבה מובנית עם שליטה על כמות הטוקנים שהיא צורכת. הוא נשען על ארכיטקטורה היברידית ומכוון לביצועים חזקים במתמטיקה וקוד.

  • 8.9Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.6 GBמשקל הקבצים
  • 429,465הורדות בחודש

מה זה

במקום עוד טרנספורמר רגיל, אנבידיה הלכה כאן על ארכיטקטורה היברידית של Mamba-2 ושכבות MLP עם ארבע שכבות תשומת לב בלבד. המבנה הזה נועד לייצר ריצה חסכונית יותר בזיכרון, במיוחד בטקסטים ארוכים שמגיעים עד 128 אלף טוקנים. המודל מתמקד ביכולות חשיבה שלב אחר שלב, אותן אפשר להפעיל או לנטרל ישירות בהוראות המערכת באמצעות פקודות פשוטות.

במבחני ביצועים עם חשיבה פעילה, הוא עוקף את Qwen3-8B ברוב המדדים. במבחן הקוד LCB הוא מגיע ל־71.1% מול 59.5%, ובמתמטיקה מורכבת של AIME25 הוא מוציא 72.1% מול 69.3%. זה אומר שכשנותנים לו לחשוב לפני שהוא עונה, הוא מצליח לפתור בעיות היגיון וקוד שדגמים אחרים בגודל שמונה ותשעה מיליארד פרמטרים מפספסים.

מתאים ל

  • פתרון בעיות קוד ב־CI

    תוצאה של 71.1% במבחן LCB וחלון הקשר רחב מאפשרים ניתוח של פונקציות וקבצי קוד שלמים.

  • סוכנים אוטונומיים

    תמיכה מובנית בהפעלת כלים ובקרת תקציב חשיבה מאפשרות לאזן בין זמני תגובה ודיוק.

  • חישובים מורכבים במערכות RAG

    תוצאה של 97.8% ב־MATH500 נותנת מענה מצוין לעיבוד נתונים מספריים מתוך מסמכים ארוכים.

איפה זה נופל

הנתונים שאומנו עליהם מגיעים עד ספטמבר 2024 בלבד, ואירועים מאוחרים יותר פשוט לא קיימים אצלו. מעבר לזה, רשימת השפות הנתמכות רשמית כוללת אנגלית, שפות מערב אירופיות ויפנית. עברית לא נכללת ברשימת התמיכה, ולכן לא הייתי בונה עליו לשום מוצר שמיועד לקהל ישראלי בשפת המקור. במשימות קיצוניות כמו מדד HLE המודל עומד על 6.5% בלבד, כך שגם עם מנגנון חשיבה פעיל הוא עדיין מוגבל מאוד בידע מדעי מעמיק.

אותה משפחה

NVIDIA-Nemotron-Nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

התיעוד הרשמי מציין תמיכה באנגלית, גרמנית, ספרדית, צרפתית, איטלקית ויפנית, לצד אזכור של קוריאנית, פורטוגזית, רוסית וסינית בדאטה המאוחר. עברית אינה מופיעה ברשימות האלו. אפשר להניח שהוא יזהה מעט מילים, אך הוא אינו מיועד לפעילות תקינה בעברית.

איך שולטים על מצב החשיבה של המודל בזמן ריצה?

אפשר להוסיף את הפקודה think או no_think בהודעת המערכת או בהודעת המשתמש כדי לכבות ולהדליק את שרשרת ההיגיון. בנוסף, בשרת vLLM ניתן להגדיר תקציב טוקנים מדויק שמאלץ את המודל לסיים את שלב החשיבה ולגשת ישר לתשובה הסופית.

איך מריצים

המשקל בפורמט bfloat16 תופס 16.6 גיגה-בייט, כך שאתם צריכים כרטיס גרפי יחיד עם לפחות 24 גיגה זיכרון כדי להריץ אותו בלי לחנוק את המערכת. אפשר להריץ אותו מקומית דרך vLLM גרסה 0.10.1 ומעלה, TensorRT-LLM או דרך transformers עם trust_remote_code מופעל. שימו לב שב־vLLM חובה להגדיר שמירת קאש של Mamba כ־float32, אחרת הדיוק נפגע.

אנבידיה מעמידה אותו גם כ־API מוכן בקטלוג שלה, וזו הבחירה ההגיונית אם אין לכם שרת ייעודי או אם אתם רק בודקים התאמה. הרצה עצמית שווה את המאמץ רק כשיש לכם חומרת אנבידיה תואמת כמו A10G או A100 ואתם רוצים לנצל את מנגנון תקציב החשיבה כדי לחסוך זמני תגובה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Nano-9B-v2")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי, אבל אינו רישיון קוד פתוח סטנדרטי מסוג MIT או Apache. מי שמתכנן להטמיע אותו במוצר מסחרי צריך לקרוא את תנאי ההסכם של אנבידיה ולוודא עמידה בהגבלות הפצה ושימוש שהחברה דורשת.

הרישיון המלא בעמוד המודל ↗