GPT
N

NVIDIA-Nemotron-Nano-12B-v2

קוד פתוח

nvidiaother2025-08-21

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל היברידי קומפקטי שמביא חשיבה מובנית ושליטה בתקציב טוקנים. הוא נותן פתרון מקומי מהיר בלי לשרוף זיכרון כמו מודלי שפה רגילים.

  • 12Bפרמטרים
  • 22.9 GBמשקל הקבצים
  • 5,724הורדות בחודש
  • 164לייקים

מה זה

במקום עוד ארכיטקטורת טרנספורמר כבדה, נבידיה שילבה פה שכבות Mamba-2 עם שש שכבות Attention בלבד. המבנה הזה מקטין את עומס הזיכרון בריצות ארוכות ומאפשר להגיע לחלון הקשר של 128K טוקנים בלי צוואר הבקבוק הרגיל של זיכרון ה־KV.

המודל כולל מנגנון חשיבה מובנה, ומאפשר לקבוע ישירות בפרומפט אם להפעיל אותו עם think/ או לכבות אותו עם no_think/. המדידות מראות תוצאות חזקות במיוחד למתמטיקה ולוגיקה, כמו 97.75% ב־MATH500 ו־76.25% ב־AIME25, לצד 70.79% בייצור קוד ב־LCB כשמצב החשיבה פעיל. כשמכבים את החשיבה הביצועים במשימות קשות יורדים, אבל זמן התגובה מתקצר משמעותית.

מתאים ל

  • סוכני קוד ואוטומציה

    ציון של 70.79% ב־LCB ותמיכה מובנית ב־Tool Calling ב־vLLM מתאימים למשימות פיתוח מוגדרות היטב.

  • פתרון בעיות חישוביות

    תוצאה של 97.75% ב־MATH500 ומצב חשיבה מבוקר הופכים אותו למדויק במיוחד בעיבוד נתונים לוגיים.

  • מערכות RAG מהירות

    שילוב שכבות Mamba-2 מקל על ניתוח מסמכים ארוכים בחלון של עד 128K ללא ניפוח זיכרון קיצוני.

איפה זה נופל

עברית לא נתמכת כאן באופן רשמי. רשימת השפות כוללת אנגלית, ספרדית, צרפתית, גרמנית, איטלקית ויפנית, ולכן כל שימוש בשפה מקומית ידרוש בדיקה קפדנית של הזיות ואיכות פלט ירודה. מעבר לכך, נתוני האימון מעודכנים רק עד ספטמבר 2024. נקודה נוספת היא תלות חזקה בחומרה של נבידיה, על כרטיסים אחרים או בסביבות לא סטנדרטיות המבנה ההיברידי פשוט לא ירוץ יעיל.

אותה משפחה

NVIDIA-Nemotron-Nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לפיתוח מוצר שפונה לקהל ישראלי?

לא מומלץ לבנות עליו לפלטים בעברית. המודל אומן ונבדק על אנגלית וכמה שפות אירופיות ואסייתיות בלבד, וללא תמיכה רשמית בעברית הוא צפוי להציג שגיאות דקדוק ואי דיוקים.

מה זה אומר שליטה בתקציב החשיבה בפועל?

אפשר להגביל מראש את כמות הטוקנים שהמודל מקדיש למחשבה פנימית לפני הפלט הסופי. זה מאפשר לאזן ישירות בין זמן תגובה של שניות בודדות לבין עומק הפתרון.

האם הוא יעבוד לי על מעבד רגיל בלי כרטיס מסך?

טכנית ספריות מסוימות יטענו אותו, אבל בפועל הוא לא מיועד לזה. הארכיטקטורה עברה אופטימיזציה לליבות ה־GPU של נבידיה וספריות CUDA, ועל מעבד בלבד הביצועים יהיו איטיים מדי לכל שימוש אמיתי.

איך מריצים

המשקל הגולמי עומד על 22.9GB בפורמט bfloat16, כך שצריך כרטיס בודד של 24GB דוגמת A10G או כרטיסים ארגוניים כמו A100 ו־H100. הוא מותאם במיוחד להרצה דרך vLLM, TensorRT-LLM ומערכות NeMo על לינוקס, ואפילו תומך במחשבי קצה מסוג Jetson AGX Thor.

בהרצה מקומית ב־vLLM חובה להגדיר mamba_ssm_cache_dtype כ־float32, אחרת הדיוק נפגע ישירות. אם אתם לא מחזיקים שרת GPU זמין ורציף, עדיף להשתמש ב־API מרוחק, כי עלות החזקת חומרה כזו לעומסים לא אחידים פשוט לא משתלמת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Nano-12B-v2")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי, אך כולל תנאים והגבלות משפטיות של נבידיה שצריך לבדוק לעומק לפני הפצה בתוך מוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗