GPT
N

NVIDIA-Nemotron-3-Nano-4B-BF16

קוד פתוח

nvidiaother2026-03-07

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל קטן של 4 מיליארד פרמטרים שמשלב Mamba-2 עם תשומת לב, ומביא יכולות חשיבה וחלון הקשר עצום של 262 אלף טוקנים לחומרה מקומית.

  • 4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 2,784,092הורדות בחודש

מה זה

מדובר במודל שפותח באנבידיה על ידי דחיסה של גרסת ה־9B הקודמת, כשהוא בנוי על ארכיטקטורה היברידית שמכילה בעיקר שכבות Mamba-2 ו־MLP לצד ארבע שכבות של Attention בלבד. המבנה הזה מיועד לאפשר לו לרוץ מהר וביעילות על כרטיסים גרפיים ביתיים ומכשירי קצה, בלי לצרוך כמויות זיכרון מוגזמות על חישובי הקשר ארוך. הוא מציע שליטה מלאה בתהליך החשיבה שלו, אפשר להריץ אותו עם שלב נימוק מפורט לקבלת תשובות מדויקות, או לכבות את מנגנון החשיבה ולקבל תשובה מיידית וישירה לפעולות פשוטות.

במדדי ביצועים המודל מציג פער ברור בין המצבים. במתמטיקה מתקדמת ב־MATH500 הוא מגיע ל־95.4 עם חשיבה פעילה, לעומת ביצועים חלשים יותר במשימות שיחה וסוכנים כמו מבחני Tau2 שנעים בין 24.9 ל־34.8 בלבד כשהחשיבה כבויה. בבדיקות של קריאת מסמכים וטקסטים ארוכים ב־RULER הוא שומר על 91.1 אחוז דיוק ב־128 אלף טוקנים, מה שמעיד על שמירה טובה של מידע גם בהקשר רחב. המודל שופר בעזרת שימוש ב־Qwen ומאומן על דאטה שכולל עקבות חשיבה סינתטיים מ־DeepSeek R1.

מתאים ל

  • עוזר מקומי במשחקים

    מתאים לריצה בזיכרון של כרטיס מסך ביתי לצורך הפעלת דמויות ללא שחקן שמגיבות לפקודות שחקן באנגלית.

  • קריאת מסמכים ארוכים

    מאפשר עיבוד של טקסטים ארוכים במיוחד בקוד ובאנגלית תודות לשמירה על דיוק גבוה בתוך חלון של 128 אלף טוקנים.

  • פתרון בעיות מתמטיקה

    משיג דיוק גבוה של מעל 95 אחוז במבחן MATH500 כאשר מפעילים את שלב החשיבה המלא של המודל.

איפה זה נופל

התמיכה מוגבלת לשפה האנגלית וקוד, והוא לא מתאים כלל לעבודה בעברית. במשימות מורכבות של סוכנים אוטומטיים ושיחות מרובות שלבים המודל מפגין תוצאות נמוכות מאוד, עם 22.9 בלבד במבחן Orak וציונים סביב 30 אחוז במדדי תמיכה טכנית של שירות לקוחות. אם תכבו את החשיבה תסבלו מירידה חדה ביכולת שלו לעקוב אחרי הוראות מורכבות, עם ציונים של כ־43 אחוז ב־IFBench. בנוסף תאריך סיום המידע עליו אומן הוא ספטמבר 2024, ולכן אינו מכיר אירועים עדכניים יותר.

אותה משפחה

NVIDIA-Nemotron-3-Nano יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה עבור מוצר בעברית?

לא. המודל מוגדר רשמית לתמיכה באנגלית בלבד. אימון המודל והבדיקות שפורסמו עבורו לא כוללים עברית, ולכן הוא לא יתפקד בצורה אמינה בשפה זו.

איך מחליטים אם להפעיל את מצב החשיבה?

מפעילים אותו עבור בעיות חישוב, כתיבת קוד מורכב או פתרון בעיות לוגיות שבהן הדיוק קריטי, ומכבים אותו לפעולות ישירות וקריאות לפונקציות כדי לקצר את זמן ההמתנה לתשובה.

איך מריצים

המשקל של הקבצים ב־BF16 הוא 7.4 גיגה-בייט, כך שכרטיס מסך בודד כמו RTX 3080 עם 10 גיגה זיכרון או A10G יספיק כדי להעלות אותו. אם אתם רוצים לנצל את מלוא חלון ההקשר שמגיע ל־262 אלף טוקנים, תצטרכו כרטיס עם זיכרון גדול יותר כמו A100 או H100 כדי להחזיק את כל הנתונים בריצה. המודל נתמך רשמית בריצה על vLLM החל מגרסה 0.15.1 עם פלאגין מותאם לפענוח עקבות חשיבה, וכן במנוע TRT-LLM של אנבידיה ובספריית transformers של פייתון.

הקריאה ל־API של שירות ענן מתאימה בעיקר אם אין לכם גישה לכרטיסי מסך מודרניים של אנבידיה שכן הארכיטקטורה מותאמת ישירות ל־CUDA, או כשאין לכם צורך בתגובה מקומית מהירה ופרטית בתוך מכשיר הקצה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון NVIDIA Nemotron Open Model License. הרישיון מאפשר שימוש מסחרי בחינם, אך כפוף להסכם השימוש הספציפי של אנבידיה שמגדיר את תנאי ההפצה של המודל ונגזרותיו במוצרים.

הרישיון המלא בעמוד המודל ↗