GPT
N

NVIDIA-Nemotron-3-Nano-30B-A3B-Base-BF16

קוד פתוח

nvidiaother2025-12-03

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל בסיס היברידי שמשלב Mamba2 עם MoE ומתמחה בקוד ובמתמטיקה. הוא מיועד למי שרוצה לאמן או לכוונן מודל משלו על ארכיטקטורה חסכונית שרצה עם הקשרים ארוכים במיוחד.

  • 32Bפרמטרים
  • 58.8 GBמשקל הקבצים
  • 83,985הורדות בחודש
  • 131לייקים

מה זה

מדובר במודל בסיס שאינו מיושר לשיחה, אלא פועל באמצעות חיזוי הטוקן הבא. הייחוד הטכנולוגי שלו נמצא בארכיטקטורה: שילוב של מנגנון Mamba2 עם שכבות טרנספורמר ותצורת Mixture of Experts. השילוב הזה נותן לו יתרון ביעילות החישוב וביכולת להתמודד עם הקשר ארוך של עד מיליון טוקנים, תכונה שלרוב חונקת מודלים בגודל הזה.

במבחני הביצועים מול מודלים مقבילים כמו Qwen3 30B, היתרון שלו מובהק בעיקר במשימות חישוביות וטכניות. הוא מזנק לציון של 82.88 במבחן MATH לעומת 61.14 של המתחרה, ומוביל גם בייצור קוד ב־HumanEval עם 78.05 נקודות. עם זאת, בידע כללי רחב הוא מעט נופל מאחור, עם 78.56 ב־MMLU הרגיל, כך שהוא ממוקד יותר ביכולות אנליטיות מאשר בטריוויה כללית.

מתאים ל

  • אימון מודל קוד פנים־ארגוני

    ציונים גבוהים ב־HumanEval הופכים אותו לבסיס מעולה לפיתוח כלי השלמת קוד ייעודיים.

  • פתרון בעיות מתמטיות מורכבות

    התוצאות במבחני MATH ו־GSM8K מראות דיוק חישובי גבוה במיוחד ביחס למודלים בגודל דומה.

  • פרויקטים עם קלט ארוך מאוד

    ארכיטקטורת Mamba2 והתמיכה בהקשר של 256K ומעלה מתאימות לסריקת מסמכים טכניים ענקיים.

איפה זה נופל

זהו מודל בסיס בלבד, מה שאומר שהוא אינו מיועד לשמש כצ'אט בוט מהקופסה. אם תזרקו לו שאלה בלי הכוונה, הוא ימשיך את הטקסט במקום לענות עליה. הוא דורש תהליך של כוונון עדין למעקב אחר הוראות כדי להפוך לכלי עבודה יישומי.

בנוסף, במסמך מצוין כי הסינון של דאטה בשפות שאינן אנגלית בוצע באמצעות יוריסטיקות פשוטות בלבד ולא דרך מודלי סיווג איכותיים. במבחן MMLU Global Lite הוא רושם ביצועים נמוכים יותר ממתחריו, כך שאיכות הטקסט בשפות משניות, כולל עברית, עלולה להפגין חוסר יציבות.

אותה משפחה

NVIDIA-Nemotron-3-Nano יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות בתור בוט שירות?

לא. מדובר במודל בסיס שמבצע השלמת טקסט עיוורת ולא מודל שעבר יישור שיחתי. תצטרכו להעביר אותו כוונון עדין להוראות לפני שהוא יוכל לתקשר עם לקוחות.

איך התמיכה שלו בעברית?

עברית מופיעה ברשימת השפות הנתמכות בקלט, אך אימון השפות הזרות נשען על סינון יוריסטי ולא על בקרת איכות עמוקה. מומלץ לבדוק את איכות הפלט בעברית היטב לפני שנכנסים לפיתוח.

איך מריצים

המשקל הגולמי של הקבצים בפורמט BF16 תופס כמעט 59 ג'יגה בייט. כדי לטעון אותו תצטרכו כרטיס שרת מקצועי כמו A100 או H100 עם 80GB זיכרון, במיוחד אם בונים על חלון הקשר משמעותי. ברירת המחדל בהגדרות Hugging Face מוגבלת ל־256 אלף טוקנים בגלל מגבלות הזיכרון, אף על פי שהארכיטקטורה תומכת ביותר.

אם אין לכם קלאסטר ארגוני זמין בסביבת לינוקס ותמיכה ב־NeMo או Transformers בגרסאות תואמות, עדיף לפנות ל־API ייעודי. הרצת מודל של 30 מיליארד פרמטרים על חומרה מקומית חלשה יותר פשוט לא תהיה יעילה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-Base-BF16")
print(pipe("שלום"))

הרישיון

השימוש במודל כפוף לרישיון קוד פתוח ייעודי של אנבידיה בשם NVIDIA Nemotron Open Model License. החברה מצהירה שהמודל מאושר לשימוש מסחרי, אך הרישיון דורש עמידה בתנאי ההסכם המשפטי המלא שלה ולא מסתפק ברישיונות חופשיים סטנדרטיים כמו MIT או אפאצ'י.

הרישיון המלא בעמוד המודל ↗