GPT
N

Nemotron-3-Nano-30B-A3B-GGUF

קוד פתוח

unslothother2025-12-15

  • transformers
  • gguf
  • nvidia
  • unsloth
  • text-generation

ארכיטקטורת תערובת מומחים שמשלבת Mamba-2 עם מנגנוני קשב, ודורשת רק 3.5 מיליארד פרמטרים פעילים מתוך 30 מיליארד. מתאים למי שמחפש מהירות ויכולות חשיבה מתמטיות בקובץ מכווץ.

  • 537 GBמשקל הקבצים
  • 13,667הורדות בחודש
  • 329לייקים

מה זה

מדובר במודל שפותח באנבידיה ומגיע כאן בגרסאות מכווצות של אנפוסלות׳ בפורמט GGUF. המבנה הפנימי שלו חריג בנוף, הוא מכיל 23 שכבות Mamba-2 לצד 23 שכבות תערובת מומחים ורק 6 שכבות קשב מלאות, עם ניתוב שמפעיל חמישה או שישה מומחים מתוך 128 בכל צעד חישוב. המבנה ההיברידי הזה חותך את עלויות החישוב בריצה ומאפשר להגיע להקשרים ארוכים במיוחד, עד רמה של מיליון טוקנים.

במבחני ביצועים הוא מציג יתרון בולט בפתרון בעיות מתמטיות מורכבות, עם ציון של 99.2 במבחן AIME25 בשילוב כלים חיצוניים, ותוצאה חזקה של 38.8 במבחן הקוד SWE-Bench. הוא גם יודע לעבוד בשני מצבים דרך תבנית השיחה, ייצור שרשרת חשיבה מלאה לפני התשובה, או מענה ישיר ומהיר יותר שמשלם בדיוק במשימות קשות.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מוציא 99.2 במבחן AIME25 עם כלים, ומציג שרשרת חשיבה פנימית שמפרקת שלבים מסובכים.

  • סוכני תוכנה ואוטומציה

    נבנה להפעלת כלים חיצוניים וקיבל ציון של 38.8 ב־SWE-Bench, גבוה בהרבה ממתחרים בגודל דומה.

  • ניתוח מסמכים ארוכים

    מבנה ה־Mamba ההיברידי מאפשר לו לסרוק הקשר של מאות אלפי טוקנים ביעילות זיכרון גבוהה.

איפה זה נופל

העברית לא נתמכת כאן, רשימת השפות הרשמית כוללת רק אנגלית, ספרדית, צרפתית, גרמנית, איטלקית ויפנית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומית. בנוסף, במבחני ידע כללי רב לשוניים כמו MMLU-ProX הוא משיג רק 59.5, פחות ממתחרים כמו Qwen3. במשימות כתיבה יצירתית הוא חלש יחסית, ובטרמינל הוא קיבל ציון נמוך של 8.5 בלבד במבחן Terminal Bench. אם תבטלו את מצב החשיבה, רמת הדיוק במשימות מורכבות תרד מיידית.

שאלות
נפוצות

האם המודל מתאים ליישומים בעברית?

לא. המודל אומן ונבדק על שש שפות עיקריות בלבד, אנגלית, גרמנית, ספרדית, צרפתית, איטלקית ויפנית. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן פלט בעברית עלול להיות משובש ומקוטע.

איך מבטלים את שרשרת החשיבה אם רוצים תגובה מהירה?

אפשר להגדיר בתבנית השיחה את הפרמטר enable_thinking לערך False, ולהשתמש בחיפוש חמדני (Greedy Search). המודל יחזיר תשובה סופית מיידית ללא טוקנים של מחשבה, אך רמת הדיוק שלו במשימות קשות תרד.

איך מריצים

קובצי ה־GGUF דורשים כלי הרצה כמו llama.cpp או סביבות תומכות, כאשר המאגר המלא מכיל גרסאות קוונטיזציה שונות בנפח כולל של 537 גיגה-בייט. בפועל אתם מורידים רק קובץ כיול אחד שמתאים לזיכרון שלכם, ולא את כל המאגר. מומלץ להריץ אותו עם תמיכה בהאצת חומרה מתאימה, שכן שימוש במעבד בלבד יגרור איטיות משמעותית.

אם אתם צריכים לפתוח הקשר רחב שמגיע לעשרות אלפי טוקנים או ל־256 אלף ברירת המחדל, דרישות הזיכרון של ה־VRAM יקפצו במהירות. במקרים שבהם אין לכם כרטיסי מסך חזקים כמו A100 או H100, עדיף להשתמש בנקודת קצה מנוהלת דרך ענן במקום לנסות לדחוף את ההקשר המלא לחומרה מקומית צפופה.

ollama run hf.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון פתוח ייעודי של אנבידיה בשם NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי בחינם, אך כפוף לתנאי השימוש והמגבלות של אנבידיה, ולכן חובה לקרוא את המסמך המקורי שלהם לפני הטמעה במוצר מסחרי כדי לוודא עמידה בדרישות.

הרישיון המלא בעמוד המודל ↗