GPT
N

NVIDIA-Nemotron-Nano-12B-v2-Base

קוד פתוח

nvidiaother2025-08-14

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ארכיטקטורה היברידית של Mamba-2 עם מעט שכבות Attention מאפשרת לרוץ מהר על הקשר של 128 אלף טוקנים. הוא מיועד למי שמחפש בסיס חזק לאימון המשך ולמשימות חישוב כבדות.

  • 12Bפרמטרים
  • 22.9 GBמשקל הקבצים
  • 4,832הורדות בחודש
  • 92לייקים

מה זה

מדובר במודל השלמת טקסט גולמי שנבנה על שילוב של 28 שכבות Mamba-2, עוד 28 שכבות MLP ורק שש שכבות Attention מסורתיות. המבנה הזה נועד לקצר את צוואר הבקבוק החישובי שנוצר בדרך כלל בטקסטים ארוכים, מבלי לוותר על היכולת לקשר מידע מורכב על פני כל 128 אלף הטוקנים של חלון ההקשר. האימון התבסס על עשרים טריליון טוקנים, כולל נתח משמעותי של מידע סינתטי מתקדם מדגמים כמו DeepSeek ו־Qwen.

במבחני ביצועים מול מודלים מובילים בגודל דומה, כמו Gemma3 12B או Qwen3 8B, הוא מציג יתרון ברור במשימות היגיון ומתמטיקה. ציון של 91.66 במבחן GSM8K CoT וציון של 63.98 ב־MMLU-Pro מראים שההשקעה בדאטה סינתטי ממוקד קוד וחשיבה לוגית נותנת תפוקה ישירה בדיוק התשובות, עוד ברמת מודל הבסיס ולפני שעבר כוונון ייעודי לשיחה.

מתאים ל

  • אימון מודל הוראות פנימי

    בסיס חזק עם 12 מיליארד פרמטרים שמתאים לכוונון עדין על דאטה ארגוני ייעודי.

  • פתרון בעיות חישוב ולוגיקה

    תוצאות גבוהות במבחני מתמטיקה בזכות אימון מסיבי על בעיות מדויקות ודאטה סינתטי.

  • עיבוד מסמכים ארוכים

    ארכיטקטורת Mamba-2 מאפשרת טיפול יעיל ברצפים ארוכים עד 128 אלף טוקנים.

איפה זה נופל

זהו מודל בסיס להשלמת טקסט, לא צ'אטבוט מוכן. הוא לא יענה לשאלות כעוזר אישי אלא ימשיך את הטקסט שקיבל, ולכן אי אפשר לזרוק אותו ישירות לממשק משתמש בלי אימון הוראות נוסף. בנוסף, חבילת השפות הרשמית שלו מונה 16 שפות בלבד, ועברית אינה מופיעה ביניהן. הוא לא נבדק או אומן עליה באופן ייעודי, כך שאי אפשר לסמוך על הפלט שלו בניסוחים מקומיים או במבנה תחבירי תקין.

אותה משפחה

NVIDIA-Nemotron-Nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מוכן לשימוש ישיר מול לקוחות?

לא. מדובר במודל בסיס שנועד להשלמת טקסט בלבד, ולא עבר התאמה לשיחה. הוא זקוק לתהליך של כוונון עדין והגדרת הנחיות בטיחות לפני שמשלבים אותו במוצר פעיל.

האם אפשר להשתמש בו ליישומים בעברית?

עברית אינה ברשימת השפות הנתמכות שצוינו במפרט. המודל עלול לפלוט טעויות גסות, להמציא מילים או פשוט להיכשל בהבנת ההקשר.

איך מריצים

במשקל קבצים של 22.9 גיגה בייט, הרצה מקומית ב־FP16 דורשת כרטיס עם לפחות 32 גיגה זיכרון גרפי, או שני כרטיסים ביתיים מגושרים. אנבידיה מייעדת אותו רשמית לחומרת שרתים כמו A100 ו־H100 בנפח 80 גיגה, תחת מנוע NeMo וסביבת לינוקס, שם המבנה ההיברידי מנצל את ליבות העיבוד בצורה המיטבית.

אם המטרה שלכם היא רק לקבל מענה מהיר בטקסטים ארוכים בלי להתעסק בתחזוקת שרתים או קימפול ספריות תומכות Mamba, קריאה לשרת מרוחק עדיפה בהרבה. הרצה עצמית שווה את המאמץ בעיקר כשבונים פייפליין פרטי, או כשיש צורך ממשי באימון מותאם על גבי החומרה שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Nano-12B-v2-Base")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי והפצה עולמית, ומיועד למפתחים וחוקרים שרוצים לבנות על גביו. אם אתם משלבים אותו במוצר מסחרי, חובה לקרוא את התנאים המלאים בהסכם של אנבידיה כדי לוודא עמידה בהגבלות החלות עליו.

הרישיון המלא בעמוד המודל ↗