GPT
N

NVIDIA-Nemotron-Nano-9B-v2-Base

קוד פתוח

nvidiaother2025-08-14

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל בסיס שמשלב Mamba-2 עם תשומת לב מינימלית כדי לחסוך זיכרון בהקשרים של 128 אלף טוקנים. הוא פונה למי שרוצה להריץ מודל חשיבה ומתמטיקה קומפקטי ומיועד לאימון המשך.

  • 8.9Bפרמטרים
  • 16.6 GBמשקל הקבצים
  • 1,454הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל גלם מסוג השלמת טקסט, שעבר דחיסה וזיקוק מגרסת ה־12B בעזרת כ־480 מיליארד טוקנים. השלד שלו בנוי בעיקר משכבות Mamba-2 ו־MLP, כשבכל הרשת יש רק ארבע שכבות של מנגנון Attention רגיל. המטרה של המבנה ההיברידי הזה היא להוריד דרסטית את תביעת הזיכרון של שמירת ה־KV Cache, בלי לאבד את היכולת לעבוד עם טקסטים ארוכים עד 128 אלף טוקנים.

החוזק העיקרי שלו, לפי המבחנים, הוא חשיבה אנליטית ומדעית. במבחן MATH Level 5 הוא מוציא ציון של 63.64, וב־GSM8K עם שרשרת חשיבה הוא מגיע ל־91.36. אלה תוצאות שמשאירות מאחור מודלי בסיס כמו Qwen3 8B שקיבל 29.91 ברמה 5, או Gemma3 12B שנעצר ב־17.71. מצד שני, במבחן ידע כללי פשוט כמו MMLU הוא עומד על 74.53, שזה נמוך יותר מ־Qwen3 שמגיע ל־76.44.

מתאים ל

  • אימון מודל קוד ומתמטיקה

    הוא מציג ציונים חריגים לטובה במבחני חשיבה, ולכן משמש בסיס מצוין לכוונון עדין על משימות הנדסיות.

  • ניתוח מסמכים ארוכים

    תמיכה ב־128 אלף טוקנים על ארכיטקטורת Mamba-2 מאפשרת עיבוד טקסטים ארוכים ביעילות זיכרון גבוהה.

  • מחקר על ארכיטקטורות תערובת

    הוא מאפשר לבדוק ביצועים של שילוב שכבות Mamba עם מעט תשומת לב מול טרנספורמר סטנדרטי.

איפה זה נופל

זה לא מודל לצ'אט ולא עוזר וירטואלי. הוא לא עבר יישור של הוראות, ואם תזרקו לו שאלה הוא פשוט ימשיך את המשפט. בנוסף, אין לו תמיכה מובנית בעברית. רשימת השפות כוללת 15 שפות כמו ערבית, רוסית, יפנית ואנגלית, אך עברית נעדרה לחלוטין מאימוני השפות הרשמיים, כך שכל ניסיון להשתמש בו מקומית ידרוש דאטהסט ואימון ייעודי.

אותה משפחה

NVIDIA-Nemotron-Nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו מיד כצ'אטבוט?

לא. זה מודל בסיס שנועד להשלמת טקסטים בלבד. אם תשאלו אותו שאלה הוא עשוי להמציא שאלות נוספות או להמשיך את הניסוח בלי לענות. כדי לקבל צ'אטבוט צריך לאמן אותו קודם על הוראות או להשתמש בגרסת Instruct אם תצא כזו.

איך הביצועים שלו בעברית?

חלשים מאוד עד לא קיימים. NVIDIA אימנה אותו על 15 שפות זרות ועברית אינה אחת מהן. אם תנסו לעבד איתו טקסט בעברית תקבלו פלט מקוטע או שגוי, ויידרש אימון המשך משמעותי כדי להוסיף את השפה.

איך מריצים

המשקל הכולל של הקבצים עומד על 16.6 גיגה-בייט, כך שבדיוק מלא תצטרכו כרטיס עם לפחות 24 גיגה-בייט זיכרון כדי לטעון אותו, ועדיף כרטיסים ייעודיים כמו A10G, A100 או H100 שעליהם נבדק רשמית מנוע NeMo. אם אתם עובדים עם קונטקסט מלא של 128 אלף טוקנים, החומרה הזו חובה, למרות שהארכיטקטורה ההיברידית חוסכת הרבה זיכרון ביחס לטרנספורמר מלא.

אם אין לכם כרטיסי שרת פנויים ואתם רק צריכים מודל שיחה מוכן לשימוש, אין טעם להרים אותו עצמאית. מדובר במודל בסיס שפולט המשכי טקסט ולא עונה להוראות, כך שממילא תצטרכו לאמן עליו שכבת התאמה לפני שתוכלו להנגיש אותו למשתמשי קצה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Nano-9B-v2-Base")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הדגמים הפתוחים של NVIDIA, שמאפשר שימוש מסחרי ומחקרי בעולם. עם זאת, ברישיון כזה תמיד יש תנאים משפטיים ספציפיים לגבי שימוש לרעה והפצה מחדש, כך שחובה לעבור על הנוסח של אנבידיה לפני שמשלבים את המשקלים במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗