GPT
N

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

קוד פתוח

nvidiaother2026-08-04

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שילוב של ארכיטקטורת תערובת מומחים עם שכבות ממבה מציע מהירות גבוהה בחלון ענק של מיליון טוקנים. הוא מפעיל 3 מיליארד פרמטרים מתוך 30, ומתאים למי שמחפש סוכן חכם שלא זוחל.

  • 18Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 20.1 GBמשקל הקבצים
  • 1,246,048הורדות בחודש

מה זה

מדובר במבנה היברידי שמשלב שכבות Mamba-2, מנגנוני Attention ותערובת מומחים. בזכות הניתוב הזה, המודל מחזיק 30 מיליארד פרמטרים על הנייר אבל מפעיל בפועל רק 3 מיליארד בכל שלב. הדבר חוסך משאבי חישוב ומאפשר להחזיק חלון הקשר של עד 1,048,576 טוקנים, נתון חריג למשקל כזה.

הקוונטיזציה כאן יושבת ישירות על NVFP4 בנפח קבצים של 20.1 גיגה בייט. במבחני ביצועים, הפורמט המכווץ שומר כמעט בדיוק על אותן יכולות של גרסת ה־BF16, למשל ציון 81.62 לעומת 81.94 ב־MMLU Pro, ו־52.80 מול 51.56 ב־SWE-bench Verified. זה מראה שהדחיסה לא פגעה ביכולת התכנות וההסקה, ונותנת תוצאות עבודה דומות במשקל קל בהרבה.

מתאים ל

  • סוכני תכנות אוטונומיים

    תוצאה של 52.8 ב־SWE-bench Verified יחד עם הפעלה חסכונית של 3B פרמטרים מאפשרים ריצה ארוכה ברקע.

  • ניתוח מסמכים ענקיים

    חלון של מיליון טוקנים מאפשר להעלות בסיסי ידע גדולים ישירות להקשר בלי לחתוך קבצים.

  • שרתי שירות אינטראקטיביים

    תמיכה במנגנון DSpark ב־vLLM מגיעה ליותר מ־40 טוקנים לשנייה למשתמש תחת חומרת שרת בודדת.

איפה זה נופל

הנתונים חושפים חולשה משמעותית במשימות מורכבות מסוימות. במבחן HLE המודל מקבל ציון נמוך של 10.47, ובמדד בנקאות מבוסס כלים של tau-bench הוא נעצר על 9.48 בלבד. בנוסף, רשימת השפות כוללת אנגלית, ספרדית, צרפתית, גרמנית, איטלקית ויפנית. עברית אינה מופיעה ברשימת השפות הנתמכות בכרטיס, ולכן לא הייתי בונה עליו ליישום שדורש עיבוד טקסט מקומי בלי לבדוק קודם את איכות הפלט.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס A100 ישן יותר?

כן, דרך vLLM באמצעות קרנלים של W4A16. החומרה תמיר את המשקלים בזמן אמת, אך לא תקבלו את יתרונות המהירות הייעודיים של ליבות FP4 שקיימות רק בדורות החדשים.

האם המודל מדבר וכותב בעברית?

הכרטיס מפרט שש שפות נתמכות בלבד, ועברית אינה אחת מהן. ייתכן שהוא יגיב בגלל מידע כללי מאימון הרשת, אבל הביצועים אינם נתמכים או מובטחים.

מה המשמעות של ארכיטקטורת 3B מתוך 30B?

בכל טוקן שנוצר, הניתוב מעביר את החישוב דרך מומחים מסוימים שמשקלם 3 מיליארד פרמטרים. כך מקבלים עומק של מודל 30B במהירות של מודל קטן בהרבה.

איך מריצים

אתם צריכים כרטיס בודד של H100, GB10, או GB200 כדי להריץ אותו דרך מנועים כמו vLLM או SGLang. על חומרות ללא תמיכה מובנית בחישובי FP4, כמו כרטיסי Hopper או Ampere דוגמת A100, הריצה מתבצעת דרך קרנלים מסוג W4A16. ניתן גם לעבוד מקומית דרך Ollama או llama.cpp, אך זיכרון הכרטיס יגביל את חלון ההקשר בפועל.

אם יש צורך בחלון המלא של מיליון טוקנים בעומס משתמשים גבוה, כדאי לשקול קריאה לשירות ענן מוכן או פריסה מרובת כרטיסים. הפעלה של חלון כזה מקומית תדרוש הקטנת אורך ההקשר כדי לפנות מקום לזיכרון המטמון.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4")
print(pipe("שלום"))

הקבצים

70 קבצים במאגר, 20.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפיתוח מופץ תחת רישיון OpenMDW-1.1, המסומן כ־other במאגר. הכרטיס מגדיר אותו כמיועד לשימוש מסחרי, אך היות שמדובר ברישיון ייעודי שאינו שייך לקבוצת רישיונות הקוד הפתוח המוכרים, חובה לקרוא את נוסח ההסכם באתר המיועד לפני הטמעה במוצר ייצורי.

הרישיון המלא בעמוד המודל ↗