GPT
N

NVIDIA-Nemotron-3-Nano-4B-GGUF

קוד פתוח

nvidiaother2026-03-07

  • transformers
  • gguf
  • nvidia
  • pytorch
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה קלה שמשלבת ארכיטקטורת מאמבה 2 עם מעט שכבות קשב. היא מביאה יכולת הסקה מובנית של מודל חשיבה ישירות לחומרת קצה צנועה.

  • 2.6 GBמשקל הקבצים
  • 11,375הורדות בחודש
  • 205לייקים

מה זה

מדובר במודל שפותח כדי לפתור משימות הסקה מורכבות במבנה קומפקטי של 3.97 מיליארד פרמטרים. הבסיס שלו דחוס ממודל 9B באמצעות מסגרת אלסטית, והוא בנוי כהיבריד של שכבות Mamba-2 ו־MLP יחד עם ארבע שכבות Attention בלבד. השילוב הזה שומר על דרישות זיכרון נמוכות ומהירות ריצה גבוהה בהשוואה למודלי שפה סטנדרטיים בגודל דומה.

הוא עובד עם שרשרת מחשבה מובנית, אבל מאפשר לכבות אותה דרך הנחיית מערכת כשרוצים תשובה ישירה ומהירה יותר. במבחני IFBench ו־IFEval גרסת ה־Q4_K_M מציגה ציונים קרובים מאוד למקור בפורמט BF16, סביב 81 עד 83 נקודות בעמידה בהנחיות, מה שמראה שהכימות לא פגע ביכולת שלו להבין דרישות מורכבות.

מתאים ל

  • סוכנים מקומיים למשחקים

    מאפשר הפעלת דמויות שאינן שחקן ישירות על חומרת המשתמש בלי תשלום על שרתי ענן.

  • עוזרים קוליים ברכיבי קצה

    משקל קל של 2.6 גיגה-בייט מאפשר ריצה מהירה במכשירי IoT ורובוטיקה עם תגובה מיידית.

  • ביצוע משימות קוד באופליין

    מתאים לעבודה מקומית הדורשת הבנת פקודות מדויקת באנגלית מתוך עורך הקוד ללא גישה לרשת.

איפה זה נופל

המודל מוגדר רשמית עבור אנגלית וקוד בלבד. חומרי האימון כללו שפות נוספות, אבל עברית אינה ברשימת היעדים וביצועי המודל בשפה הזו לא מובטחים כלל. בנוסף, במבחן משחקי התפקידים Orak התוצאה שלו עומדת על 19.8 נקודות בלבד, כך שלא כדאי לבנות עליו לפעולות מורכבות של סוכנים אוטונומיים בעולמות פתוחים בלי בדיקה קפדנית.

אותה משפחה

NVIDIA-Nemotron-3-Nano יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מגדיר תמיכה באנגלית ובשפות תכנות בלבד. למרות שחלק מנתוני האימון כללו שפות אחרות, עברית לא נתמכת רשמית ולכן צפויים שיבושים ניכרים בניסיון לייצר טקסט עברי.

האם חייבים להשתמש במצב שרשרת המחשבה?

לא. אפשר להגדיר בהנחיית המערכת יצירת תשובה סופית בלבד, אך היצרן מציין שבמשימות הסקה מורכבות צפויה ירידה מסוימת ברמת הדיוק ללא שלב החשיבה.

איך מריצים

הקובץ שוקל 2.6 גיגה-בייט, מה שמאפשר לו להיכנס בקלות לכל כרטיס מסך ביתי מסדרת GeForce RTX או למכשירי Jetson. מריצים אותו ישירות מול שרת מקומי של llama.cpp באמצעות הפקודה llama-server, תוך הטענת כל השכבות לזיכרון ה־VRAM.

אם אתם צריכים זמני תגובה אפסיים עבור עוזרים קוליים או רכיבי IoT מקומיים, הרצה עצמית על חומרה מקומית עדיפה בהרבה על תלות ברשת. שירותי ענן יהיו עדיפים רק אם אתם מתכוונים לעבד טקסטים עצומים שמתקרבים למגבלת ההקשר המלאה ודורשים זיכרון עבודה רחב בהרבה.

ollama run hf.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF:Q4_K_M

הקבצים

8 קבצים במאגר, 2.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Nemotron Open Model License. הרישיון מאפשר שימוש מסחרי במוצרים, אך הוא אינו רישיון קוד פתוח חופשי סטנדרטי ומחייב בדיקה של תנאי ההסכם של אנבידיה לפני הטמעה באפליקציות מסחריות.

הרישיון המלא בעמוד המודל ↗