GPT
N

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

קוד פתוח

nvidiaother2026-06-24

  • transformers
  • safetensors
  • nemotron_h_puzzle
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זהו מודל שיחה והסקה דחוס של אנבידיה שנועד לתת תפוקת שרת גבוהה במיוחד. שווה לבחון אותו בעיקר אם מריצים עומסים כבדים של סוכנים או הקשרים ארוכים על חומרת בלקוול.

  • 45Bפרמטרים
  • 262,144טוקנים בהקשר
  • 49.9 GBמשקל הקבצים
  • 155,956הורדות בחודש

מה זה

מדובר בגרסה דחוסה של מודל האב Nemotron-3-Super-120B-A12B, שצומצם ל־75 מיליארד פרמטרים בסך הכול ו־9.3 מיליארד פרמטרים פעילים לכל טוקן. אנבידיה שילבה פה ארכיטקטורת MoE היברידית של שכבות Mamba ו־Attention יחד עם חיזוי רב-טוקנים (MTP), במטרה לחתוך את עלויות הריצה בלי לרסק את הביצועים.

במבחני ביצועים, גרסת ה־NVFP4 שומרת כמעט במדויק על רמת הדיוק של גרסת ה־BF16 המקורית, עם 89.9 ב־AIME25 ו־79.9 ב־LiveCodeBench. במבחני סוכנים התוצאות מורכבות יותר, עם ממוצע של 59.9 ב־TauBench V2 ונפילה ל־23.4 ב־Terminal Bench הקשה, מה שמראה שהחיסכון בחישוב לא פותר את הקושי במשימות מסוף מורכבות.

מתאים ל

  • סוכני שיחה מרובי צעדים

    אימון ה־RL הממוקד וארכיטקטורת MoE מאפשרים שרשור פניות מהיר בתפוקת שרת גבוהה.

  • ניתוח מסמכים ארוכים

    תמיכה בחלון הקשר של עד מיליון טוקנים עם תוצאה של 93.2 במבחן RULER.

  • ייצור קוד ומשימות תכנות

    תוצאה של 79.9 ב־LiveCodeBench לצד תמיכה בחיזוי רב-טוקנים לקיצור זמני תגובה.

איפה זה נופל

המודל מציג ביצועים נמוכים במיוחד ב־Terminal Bench Hard עם ציון של 23.4, וציון של 15.7 בלבד ב־HLE ללא כלים, כך שהוא מוגבל מאוד בהפעלת פקודות מערכת מסובכות. מעבר לכך, אין לו תמיכה רשמית בעברית אלא רק בשבע שפות שכוללות אנגלית, צרפתית, גרמנית, איטלקית, יפנית, ספרדית וסינית. כרטיס המודל מציין מפורשות שהנתונים ששימשו לאימון אינם מייצגים באופן שווה קבוצות דמוגרפיות ומכילים הטיות מגדריות ואתניות, ולכן חובה לבצע בדיקות מקיפות לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם אפשר להריץ את המודל בעברית?

רשימת השפות הנתמכות כוללת שבע שפות בלבד, ביניהן אנגלית, צרפתית וספרדית, ועברית אינה מופיעה בהן. אם המוצר שלכם פונה לקהל ישראלי ודורש עיבוד טקסט בעברית, תצטרכו לבדוק את איכות הפלט בעצמכם או להסתמך על מודל אחר שמיועד לכך.

מה המשמעות של NVFP4 בפועל מבחינת תשתיות?

הפורמט הזה דורש מעבדים גרפיים מדור Blackwell של אנבידיה כדי לנצל את מלוא החיסכון ברוחב הפס ובזיכרון. קבצי המודל שוקלים 49.9 ג'יגה-בייט, כך שהוא נכנס בקלות לחומרה מודרנית בהשוואה לגרסת ה־120B המקורית, אך מנעד המעבדים שמריצים NVFP4 בצורה יעילה מצומצם מאוד כרגע.

איך מריצים

הגרסה הזו מכוילת ב־NVFP4 ותפורה לחומרת Blackwell של אנבידיה, בלינוקס בלבד, דרך vLLM או Transformers החל מגרסה 5.3.0. אנבידיה ממליצה להריץ שרת vLLM עם מקביליות טנזורים של 2 או 4, ומסמנת שהמודל מצליח להחזיק 8 בקשות של מיליון טוקנים במקביל על H100 בודד.

אם אין לכם קלאסטר מודרני מבוסס Hopper או Blackwell, עדיף לפנות ל־API חיצוני. התלות המוחלטת בפורמט NVFP4 ובקרנלים של Mamba הופכת הרצה עצמית על חומרה ישנה יותר או מתוצרת אחרת לבלתי רלוונטית.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון OpenMDW-1.1. כרטיס המודל מציין מפורשות שהוא מאושר לשימוש מסחרי, אך הפרויקט עצמו אינו מקבל תרומות קוד חיצוניות. לפני הפצה מסחרית בתוך מוצר יש לוודא עמידה בכל סעיפי הסכם הרישיון של OpenMDW.

הרישיון המלא בעמוד המודל ↗