GPT
N

unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF

קוד פתוח

unslothother2026-03-16

  • gguf
  • nvidia
  • pytorch
  • text-generation
  • en

דחיסה של מודל מחשבה לגודל ארבעה מיליארד פרמטרים, שמביאה חלון הקשר של 262 אלף טוקנים ישירות לכרטיסי מסך מקומיים.

  • 67.2 GBמשקל הקבצים
  • 6,965הורדות בחודש
  • 81לייקים

מה זה

מדובר במודל שנוצר מדחיסה של מודל תשעה מיליארד פרמטרים של אנבידיה, ומבוסס על ארכיטקטורה היברידית של שכבות ממבה שתיים לצד ארבע שכבות תשומת לב בלבד. השילוב הזה שומר על דרישות זיכרון נמוכות ומאפשר עיבוד רצפים ארוכים במיוחד.

הוא מתוכנן לפעול בשני מצבים, עם שרשרת חשיבה מובנית או בלעדיה, בהתאם להגדרה בפרומפט המערכת. במבחני ביצועים עם חשיבה פעילה הוא מגיע לציון של 78.5 בבחינת AIME25 וציון של 95.4 ב־MATH500, מה שמראה יכולת אנליטית גבוהה לגודל שלו. כשמכבים את החשיבה הביצועים במשימות מורכבות יורדים, למשל במדד IFEval הציון יורד מ־87.9 ל־82.8 ברמת הפרומפט.

מתאים ל

  • בוטים ודמויות במשחקי מחשב

    זמני תגובה מהירים במכשיר הקצה לצד יכולת שיחה והפעלת כלים מקומית.

  • אוטומציה והפעלת כלים

    קריאות לפונקציות בקוד עם ביצועים יציבים של שישים ואחד אחוז במדד BFCL.

  • ניתוח מסמכים טכניים באנגלית

    חלון הקשר של 262 אלף טוקנים מאפשר הזנת קבצי קוד ומפרטים שלמים.

איפה זה נופל

התמיכה הרשמית מוגבלת לאנגלית בלבד, ואין לו הכשרה ייעודית לעברית. במשימות תפעוליות בעולם האמיתי הוא עדיין מתקשה, כפי שרואים בציונים הנמוכים במדדי Tau2, שנשארים סביב שלושים ושלושה אחוזים גם כשמצב החשיבה דולק. תאריך העדכון של נתוני האימון המקדימים נעצר בספטמבר 2024, כך שהוא לא מכיר אירועים מאוחרים יותר.

שאלות
נפוצות

האם המודל עובד בעברית?

המודל הוכשר ונתמך רשמית באנגלית ובשפות תכנות. מאחר שהוא לא עבר התאמה לעברית, לא מומלץ לבנות עליו לפרויקטים מקומיים.

איך שולטים במצב החשיבה של המודל?

השליטה מתבצעת ישירות בהגדרת הפרומפט בעזרת ביטול פרמטר החשיבה בתבנית השיחה. כיבוי המצב מאיץ את התגובה אך מוריד את הדיוק במשימות מורכבות.

איך מריצים

הריצה המקומית בגרסאות GGUF מתבצעת דרך מנועים תומכים כמו llama.cpp, vLLM או TensorRT-LLM, כאשר המשקל הכולל של הקבצים במאגר עומד על 67.2 גיגה בייט ומחולק בין 25 קבצים בדרגות כימות שונות. כדי להריץ קובץ מכומת יחיד של ארבעה מיליארד פרמטרים מספיק כרטיס מסך ביתי מסדרת GeForce RTX עם שמונה עד שישה עשר גיגה זיכרון.

במקרים של עומסי קריאות מקבילים או כשאין גישה לחומרה ייעודית של אנבידיה עם תמיכה בהאצת ממבה, שימוש בשרת ענן ייעודי ייתן יציבות גבוהה יותר. בנוסף, חילוץ תגיות החשיבה דורש טיפול מפורש בטוקנים של תחילת וסיום מחשבה בזמן הקריאה.

ollama run hf.co/unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר תחת רישיון המודלים הפתוח של אנבידיה. הרישיון מאפשר שימוש מסחרי ומיועד להפצה גלובלית, אך כפוף למגבלות המשפטיות של ההסכם הרשמי ודורש אימות של תנאי ההפצה מול מסמכי אנבידיה לפני הטמעה במוצר סופי.

הרישיון המלא בעמוד המודל ↗