GPT
N

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF

קוד פתוח

unslothother2026-08-12

  • transformers
  • gguf
  • nvidia
  • pytorch
  • nemotron-3.5

גרסת GGUF של אנבידיה שמשלבת מודל תערובת מומחים עם מאמבה 2. היא מיועדת למי שרוצה להריץ מודל של 30 מיליארד פרמטרים עם ביצועים של 3 מיליארד בלבד בכל צעד.

  • 467 GBמשקל הקבצים
  • 151,498הורדות בחודש
  • 97לייקים

מה זה

מדובר בארכיטקטורה היברידית לא שגרתית שמשלבת שכבות Mamba-2 יחד עם Mixture of Experts ומעט שכבות Attention. מתוך 30 מיליארד פרמטרים בסך הכול, רק 3 מיליארד פעילים בכל טוקן, מה שמקנה לו מהירות חישוב גבוהה ביחס לגודל המלא. המודל תומך בחלון הקשר ענק שמגיע עד מיליון טוקנים, כולל מצב חשיבה מובנה שאפשר להדליק ולכבות דרך הטמפלייט של הצ'אט.

במבחני הביצועים הוא מציג תמונה מעורבת. במשימות תכנות כמו SWE-bench Verified הוא מקבל 51.56 אחוז, שזה נמוך משמעותית ממתחרים מקבילים כמו Qwen 3.6 35B שמגיע ל־70.12 אחוז. לעומת זאת, במבחני ידע וניתוח כמו GPQA Diamond הוא מחזיק ציון יפה של 75.44 אחוז, מה שמראה שהחוזק שלו נמצא יותר בחשיבה כללית ובקריאת מסמכים ארוכים ופחות בסוכני קוד אוטומטיים מורכבים.

מתאים ל

  • עיבוד מסמכי ענק

    תמיכה בחלון הקשר של עד מיליון טוקנים עם ארכיטקטורת מאמבה מהירה, שמתאימה לסריקת קבצים ארוכים.

  • שירותי שיחה רב לשוניים

    מענה מהיר באנגלית, ספרדית, גרמנית או יפנית בזכות הפעלה של 3 מיליארד פרמטרים בלבד בכל שלב.

  • הפעלת פונקציות וכלים

    תמיכה מובנית בשילוב קריאות כלים ישירות במבנה השיחה עבור בוטים מבוססי משימות מוגדרות.

איפה זה נופל

החיסרון המרכזי הוא ביצועי קוד וסוכנים, שבהם המודל מפגר באופן ברור מול חלופות מובילות בקטגוריה. במבחן Terminal-Bench הוא משיג 24.58 אחוז בלבד לעומת מעל 44 אחוז אצל המתחרים הישירים. בנוסף, עברית אינה מופיעה ברשימת השפות הנתמכות של המודל, שכוללת רק אנגלית, ספרדית, צרפתית, גרמנית, איטלקית ויפנית, כך שפניות בעברית ייצרו פלט באיכות נמוכה ולא עקבית. יש לקחת בחשבון גם הטיות בנתוני האימון שהיוצגות בכרטיס, כמו ייצוג יתר לגברים ולמקורות מסוימים.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

לא מומלץ. עברית אינה נכללת ברשימת השפות הרשמיות של המודל, שכוללת רק אנגלית וחמש שפות נוספות. ניסיון לעבוד איתו בעברית יוביל לפלט חלקי או שגוי.

כמה זיכרון דרוש כדי להריץ את המודל?

עבור המודל המלא ללא כימות נדרש כרטיס עם 80 גיגה בייט דוגמת A100 או H100. קובצי ה־GGUF המכומתים כאן מאפשרים לרדת בדרישות הזיכרון, בהתאם לגרסת הכימות שתבחרו להוריד מתוך המאגר.

איך שולטים על מצב החשיבה של המודל?

השליטה מתבצעת דרך משתנה enable_thinking בטמפלייט של השיחה. אפשר להגדיר אותו כפעיל לקבלת פירוט שלבי המחשבה, או לכבות אותו כדי לקבל תשובות ישירות ומהירות.

איך מריצים

המאגר הזה כולל קובצי GGUF במשקל כולל של 467 גיגה בייט שמחולקים ל־21 קבצים, שזה למעשה אוסף של כמה רמות כימות שונות מבית Unsloth. כדי להריץ את הגרסאות המכומתות היטב תצטרכו זיכרון שמתאים לגודל הקובץ הספציפי שתורידו, אך המודל המקורי דורש כרטיסים כמו A100 או H100 עם 80 גיגה בייט כדי להחזיק הקשר ארוך.

אם אין לכם כרטיס שרת ייעודי שתומך בהאצת מאמבה כמו פלאש אינפר, מהירות הריצה המקומית עלולה לאכזב. במקרים שבהם אתם צריכים רק שירות יציב בלי לתחזק שרת עם קבצי ענק, עדיף לפנות ל־API ייעודי במקום להוריד מאות גיגה בייטים של משקלים.

ollama run hf.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון OpenMDW גרסה 1.1, שמסומן במאגר כרישיון מסוג other. הרישיון מאפשר שימוש מסחרי, אך הוא כולל תנאים והגבלות משפטיות ספציפיות שחובה לקרוא בנוסח המלא לפני שמטמיעים אותו במוצר פיתוח מסחרי.

הרישיון המלא בעמוד המודל ↗