GPT
N

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

קוד פתוח

nvidiaother2026-08-01

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שילוב היברידי של מנגנון מומחים עם מאמבה שמפעיל רק 3 מיליארד פרמטרים בכל שלב. הוא מיועד למי שמחפש משקולות נקיות ברמת דיוק מלאה כבסיס לאימון המשך או כיול עצמאי.

  • 32Bפרמטרים
  • 262,144טוקנים בהקשר
  • 61.3 GBמשקל הקבצים
  • 478,501הורדות בחודש

מה זה

הארכיטקטורה כאן חריגה בנוף. היא מערבבת שכבות Mamba-2 יחד עם MoE ותשומת לב, ובסך הכל כוללת 30 מיליארד פרמטרים כשבפועל רק עשירית מהם פעילים בכל טוקן. המטרה של שחרור ה־BF16 הזה היא לא ריצה ישירה בייצור, אלא נקודת מוצא להתאמה אישית, אימון מחדש בשיטות כמו SFT או זיקוק, והפקת גרסאות מקווצות שלכם.

במדדי ביצועים המצב מורכב. במבחני סוכנים וכתיבת קוד כמו SWE-bench Verified הוא עומד על 51.56, תוצאה סבירה לגודלו אבל נמוכה משמעותית מול Qwen 3.6 35B שמגיע ל־70.12. בהבנת הוראות במבחן IFBench הוא מציג 71.88, ובידע כללי ב־MMLU Pro הוא מגיע ל־81.94, כך שמדובר בבסיס יציב אך לא כזה שמוביל את הטבלאות בכל משימה מורכבת.

מתאים ל

  • אימון המשך והתאמה לתחום

    משקולות מלאות ב־BF16 שמתאימות במיוחד כבסיס נקי לכוונון מודלים בעזרת NeMo RL וזיקוק נתונים.

  • בניית גרסאות קוונטיזציה

    נקודת מוצא מלאה להפקת משקלים מכווצים בפורמטים מותאמים אישית כמו GGUF לחומרה מקומית.

  • סוכני שיחה מרובי שלבים

    המודל כולל מנגנון חשיבה מובנה ופיענוח קריאות כלים שמאפשרים שילוב במערכות אוטונומיות באנגלית.

איפה זה נופל

חולשת המודל בולטת במשימות תכנות מעשיות, שם הוא מפגר אחרי מתחרים ישירים כמו Gemma 4 ו־Qwen 3.6 במבחני SciCode ו־Terminal-Bench. נוסף על כך, עברית אינה מופיעה ברשימת השפות הנתמכות, שכוללת רק אנגלית, ספרדית, צרפתית, גרמנית, איטלקית ויפנית, ולכן אי אפשר לבנות עליו לעיבוד שפה מקומית ללא אימון נוסף. לפני שילובו במערכת נדרש גם לבדוק תאימות תוכנה ספציפית בגלל התלות במנגנוני האצה ייחודיים לשכבות המאמבה.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־BF16 הזו על כרטיס גרפי ביתי?

לא. הקבצים שוקלים מעל 61 גיגה-בייט ודורשים לפחות מאיץ מקצועי יחיד של 80GB כמו H100 רק כדי להיטען. לשימוש מקומי במחשבים אישיים צריך לחכות או להמיר לגרסאות מקוונטטות כמו GGUF.

מה היתרון של המודל הזה מול מודלים רגילים בגודל 30B?

היתרון טמון במבנה ה־MoE ההיברידי שלו. למרות שהוא מכיל 30 מיליארד פרמטרים, בזמן ריצה פעילים רק 3 מיליארד, מה שמאפשר מהירות תגובה גבוהה משמעותית ביחס למודל דחוס באותו סדר גודל.

איך מריצים

כדי להעלות את משקלי ה־BF16 האלה צריך חומרה ייעודית וכבדה. כרטיס H100 בודד של 80GB מסוגל להחזיק אותו עם מנועי vLLM או SGLang, אבל בגלל מגבלות זיכרון חלון ההקשר מוגבל בו ל־256 אלף טוקנים. ניצול מלוא החלון שמגיע למיליון טוקנים דורש שרת של שמונה כרטיסי H100 עם חלוקת מומחים מקבילית, או כרטיסים מדור Blackwell כמו B200 ו־GB200.

אם היעד הוא פריסה מיידית לשירות משתמשים בלי כוונה לאמן, עדיף לפנות לגרסת ה־NVFP4 המכווצת או לצרוך אותו דרך שירות ענן. הרצת משקולות מלאות ששוקלות מעל 60 גיגה-בייט על חומרה יקרה שווה את ההשקעה רק כשאתם מאמנים עליהם שכבות חדשות.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16")
print(pipe("שלום"))

הרישיון

הפצת המשקולות מנוהלת תחת רישיון ייעודי בשם OpenMDW בגרסה 1.1, והוא מוגדר כמאושר לשימוש מסחרי. עם זאת, לא מדובר ברישיון קוד פתוח סטנדרטי מסוג MIT או Apache, ולכן צוותים משפטיים צריכים לבדוק את התנאים והמגבלות של המסמך המקורי לפני הפצה של מוצר סופי.

הרישיון המלא בעמוד המודל ↗