GPT
N

NVIDIA-Nemotron-Nano-9B-v2-Japanese

קוד פתוח

nvidiaother2026-02-04

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל של אנבידיה שמשלב שכבות Mamba-2 עם תשומת לב, ומיועד להסקת מסקנות וקריאות לכלים ביפנית. הוא מאפשר לשלוט בתקציב החשיבה כדי לאזן בין זמני תגובה לדיוק.

  • 8.9Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.6 GBמשקל הקבצים
  • 3,317הורדות בחודש

מה זה

מדובר במודל של כמעט 9 מיליארד פרמטרים שמבוסס על שילוב של שכבות Mamba-2 ו־MLP עם ארבע שכבות Attention בלבד. אנבידיה יפן לקחה את הדגם הבסיסי ואימנה אותו על מאגרי מידע של קריאות לכלים כדי להפוך אותו למודל שמתמחה בשפה היפנית. הייחוד העיקרי שלו הוא יכולת חשיבה מובנית שמייצרת שלבי הסקה פנימיים לפני התשובה הסופית, אותם אפשר להגביל או לכבות דרך הפרומפט.

במבחני הביצועים של Nejumi ביפנית, הוא קיבל ציון ממוצע של 0.711 לעומת 0.690 של Qwen3-8B. הוא מוביל בפער ניכר במבחני הימנעות מהזיות עם ציון של 0.960 מול 0.800, וגם במבחני הפעלת כלים. מנגד, במשימות תכנות הוא מציג חולשה ברורה עם ציון של 0.025 בלבד ב־SWE-Bench, שם הדגם המתחרה עוקף אותו בהרבה.

מתאים ל

  • סוכנים אוטונומיים ביפנית

    הוא אומן ייעודית על קריאות לכלים ומציג ביצועים עדיפים במבחני BFCL v3.

  • צ'אטבוטים עם תקציב זמן

    אפשר להגביל מראש את כמות טוקני החשיבה שלו כדי לא לחרוג מזמני תגובה.

  • מערכות RAG ביפנית

    השילוב של הקשר עד 128 אלף טוקנים וציון גבוה של 0.960 בהימנעות מהזיות מתאים לשליפת מידע.

איפה זה נופל

במשימות הנדסת תוכנה וכתיבת קוד מורכב המודל הזה כמעט חסר תועלת, כפי שמעיד ציון של 0.025 בלבד במבחן SWE-Bench. בנוסף, חלון ההקשר המלא של 128 אלף טוקנים עלול לדרוש הפחתה של כמות הרצפים המקבילים כדי למנוע קריסות זיכרון. תאריך המידע שלו נעצר בספטמבר 2024, והאימון שלו ממוקד לחלוטין ביפנית ובאנגלית, כך שאין מה לצפות לביצועים בעברית.

שאלות
נפוצות

האם חייבים לתת למודל לחשוב בכל שאלה?

לא. אפשר להגדיר בפרומפט ביטול של תהליך ההסקה ולקבל ישר תשובה. עם זאת, אנבידיה מציינת שבשאלות קשות הדיוק שלו יורד מעט אם מבטלים את החשיבה.

למה vLLM דורש הגדרה ידנית מיוחדת עבורו?

הארכיטקטורה משלבת שכבות Mamba-2, וכדי לשמור על דיוק החישובים חובה להוסיף את הדגל שמגדיר את מטמון הממבה ל־float32. בלעדיו איכות הפלט נפגעת.

איך מריצים

המודל שוקל 16.6 גיגה-בייט בפורמט bfloat16, כך שתצטרכו כרטיס עם 24 גיגה-בייט זיכרון גרפי לפחות, או מעבדים ייעודיים כמו A10G, A100 או H100 שעליהם הוא נבדק. כדי להריץ אותו כמו שצריך ב־vLLM חובה להשתמש בגרסה 0.11.2 ומעלה ולהגדיר מפורשות את זיכרון הממבה ל־float32, אחרת מאבדים דיוק.

הוא תומך ב־Transformers, TensorRT-LLM ו־vLLM, כולל דוקר רשמי והרצה על חומרות ייעודיות כמו Jetson. אם אין לכם שרת עם מאיץ מתאים של אנבידיה, הרצה מקומית פשוט לא תהיה יעילה ותרצו לפנות לתשתית ענן מוכנה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Nano-9B-v2-Japanese")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הדגמים הפתוחים של אנבידיה, NVIDIA Nemotron Open Model License Agreement. הרישיון מתיר שימוש מסחרי, אך כולל תנאים וסייגים משפטיים ספציפיים של החברה שצריך לקרוא לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗