GPT
D

DeepSeek-V4-Pro-NVFP4

קוד פתוח

nvidiamit2026-05-14

  • Model Optimizer
  • safetensors
  • deepseek_v4
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל ענק עם ארכיטקטורת מומחים שמיועדת להסקה מהירה על חומרת בלקוול. היא מאפשרת להריץ משימות היגיון וקוד מורכבות עם תמיכה בחלון הקשר של מיליון טוקנים.

  • 910Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 850 GBמשקל הקבצים
  • 138,142הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה בפורמט NVFP4 של מודל DeepSeek-V4-Pro, שנוצרה באמצעות כלי האופטימיזציה של אנבידיה. הארכיטקטורה מבוססת על תערובת מומחים עם היבריד אטנשן, שמפעילה רק 49 מיליארד פרמטרים בכל שלב מתוך סך כולל של כ־1.6 טריליון פרמטרים. המודל מציע שלושה מצבי חשיבה נפרדים, החל ממענה מהיר ללא חשיבה מעמיקה ועד למצב חשיבה מקסימלי לפתרון בעיות סבוכות.

היתרון המרכזי של הכיווץ הזה הוא שמירה כמעט מלאה על ביצועי המקור. במבחני ההערכה של אנבידיה, דיוק המודל ב־GPQA Diamond עומד על 89.33 לעומת 89.49 בגרסת ה־FP8, ובמבחן הקוד המדעי SciCode הוא אפילו מציג ציון של 53.45 לעומת 51.08 ב־FP8. היכולת לשמור על עמידה בהוראות ובדיקת הקשר ארוך ב־AA-LCR נשארת יציבה סביב 66.33, מה שמראה שהמעבר לארבע ביט כמעט ולא פגע באיכות הפלט.

מתאים ל

  • סוכני תמיכה ותפעול

    המודל השיג ציון של 94.83 במבחן שירות הלקוחות של טלקום, ומתאים לביצוע פעולות מורכבות וקריאות לכלים חיצוניים.

  • פתרון בעיות קוד ומדע

    ציון של 53.45 במבחן SciCode ומצב חשיבה עמוקה מאפשרים לו להתמודד בהצלחה עם הנדסת תוכנה וחישובים מתמטיים.

  • ניתוח משימות בהקשר ארוך

    תמיכה בחלון של עד מיליון טוקנים מאפשרת לעבד עשרות מסמכים בפרומפט יחיד, עם שליטה בפלט מובנה של JSON.

איפה זה נופל

המודל אומן על נתונים שנאספו מהאינטרנט וכוללים שפה פוגענית והטיות חברתיות, ולכן הוא עלול להגביר הטיות אלו או לייצר תוכן פוגעני גם כשלא קיבל הנחיה מפורשת לכך. בנוסף, הכרטיס מציין במפורש שהוא עלול לספק תשובות שגויות, להשמיט מידע קריטי או לייצר טקסט מיותר ולא רלוונטי. במבחן שליפת המידע מהקשר ארוך הוא משיג ציון של 66.33 בלבד, כך שלא הייתי סומך עליו בעיניים עצומות לניתוח מסמכים ארוכים ללא מנגנון אימות נוסף.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי Hopper או כרטיסים ישנים יותר?

לא. התאימות ברמת המיקרו־ארכיטקטורה של גרסת NVFP4 הזו מוגדרת רשמית עבור כרטיסי NVIDIA Blackwell בלבד. ניסיון להריץ אותה על מעבדים גרפיים מדורות קודמים לא יעבוד או לא ייתן את יתרונות הביצועים של הפורמט.

מה ההבדל בין שלושת מצבי החשיבה של המודל?

המודל כולל צינור קידוד ייעודי עם מצב ללא חשיבה שמתאים לתשובות מהירות, מצב חשיבה גבוה לניתוח לוגי, ומצב חשיבה מקסימלי שמשתמש במלוא יכולת ההיסק לפתרון בעיות מורכבות. אתם בוחרים את המצב לפי המשימה והאיזון הנדרש בין זמן התגובה לעומק הפתרון.

איך מריצים

כדי להריץ משקל של 850 גיגה־בייט בפורמט NVFP4 תצטרכו חומרה מסדרת NVIDIA Blackwell בלבד, על גבי מערכת לינוקס. הבדיקות שבוצעו נערכו על כרטיסי Blackwell B200 ועל שרתי GB300, באמצעות מנועי הסקה כמו vLLM או SGLang בחלוקה לכמה מעבדים גרפיים במקביל.

אם אין לכם קלאסטר כזה בארגון, אין טעם לנסות לפרוס את המודל עצמאית. הדרישות לחומרה ייעודית, תמיכה במעבדי בלקוול וניהול הזיכרון הופכים את ההרצה המקומית ללא רלוונטית למרבית החברות, ועדיף להשתמש בנקודת קצה מנוהלת דרך ספק ענן חיצוני.

pip install -U huggingface_hub
hf download nvidia/DeepSeek-V4-Pro-NVFP4

הקבצים

93 קבצים במאגר, 850 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT, שזה הרישיון הכי מתירני שיש. מותר לכם להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים פנימיים או מסחריים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗