GPT
D

DeepSeek-V4-Flash-NVFP4

קוד פתוח

nvidiamit2026-05-18

  • Model Optimizer
  • safetensors
  • deepseek_v4
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל ענק עם חלון הקשר של מיליון טוקנים, שרצה מהר יותר על חומרה תואמת. היא מיועדת למי שמחפש יכולות חשיבה וסוכנים בלי לשלם על עלויות הזיכרון המלאות.

  • 167Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 157 GBמשקל הקבצים
  • 212,258הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של אנבידיה למודל DeepSeek-V4-Flash, בארכיטקטורת תערובת מומחים עם 284 מיליארד פרמטרים בסך הכול, שמתוכם 13 מיליארד פעילים בכל טוקן. המודל כולל מנגנון שמאפשר לבחור בין שלושה מצבי חשיבה, החל ממענה מהיר ללא שלב ביניים ועד חקירה לוגית מעמיקה, לצד תמיכה בקריאות לפונקציות ופלט של ג'ייסון מובנה.

הכיווץ לפורמט NVFP4 בוצע על שכבות הלינאר בבלוקי המומחים בלבד. מבחני הביצועים מראים שהדיוק כמעט לא נפגע ביחס למקור, עם ירידה זניחה בלבד בשאלות מדעיות מורכבות כמו GPQA Diamond מתוצאה של 0.894 ל־0.891, שמירה על ציון 0.481 בכתיבת קוד מדעי, ואפילו עליה קלה ל־0.795 במעקב אחר הוראות מורכבות.

מתאים ל

  • סוכנים עם גישה לכלים

    הוא הגיע לתוצאה של 0.942 במבחן Telecom ומסוגל להפעיל כלים ולפתור בעיות מורכבות מול משתמשים.

  • ניתוח מסמכים ארוכים

    חלון של מיליון טוקנים עם תוצאת שחזור של 0.655 מתאים לעיבוד מאגרי מידע גדולים ללא חיתוך.

  • פתרון בעיות הנדסיות

    שלושת מצבי החשיבה מאפשרים להקצות עומק חישובי גבוה לחישובים וקוד מדעי ברמת מומחה.

איפה זה נופל

המודל אומן על מידע גולמי מהאינטרנט שכולל הטיות תרבותיות ושפה רעילה, והוא עלול לחזור עליהן או להחמיר אותן אפילו בלי לקבל שאילתה פוגענית באופן מפורש. בנוסף, הוא עלול להמציא תשובות שגויות, להחסיר פרטים חשובים או לפלוט תוכן מיותר, מה שמחייב מנגנוני בדיקה וסינון עצמאיים לפני שהוא נחשף למשתמשי קצה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך מדור Hopper כמו H100?

לא, המודל הזה מותאם ומוגדר ספציפית לארכיטקטורת Blackwell של אנבידיה. הרצת NVFP4 בצורה יעילה תלויה ביכולות החומרה של הדור הזה בלבד.

מה היתרון של ארכיטקטורת המומחים לעומת מודל דחוס רגיל?

היא מחזיקה 284 מיליארד פרמטרים בזיכרון אך מפעילה רק 13 מיליארד בכל רגע נתון. זה מאפשר לקבל קיבולת ידע גדולה מאוד לצד מהירות תגובה גבוהה יותר בזמן ריצה.

איך מריצים

כדי להריץ אותו צריך חומרת Blackwell של אנבידיה, כמו כרטיסי B200 או מערכות GB300, לצד מערכת הפעלה מבוססת לינוקס. ההרצה דורשת חלוקה לכמה מעבדים גרפיים, למשל מקביליות של ארבעה כרטיסים תחת vLLM או שמונה כרטיסים תחת SGLang, עם מפתח הזיהוי של המודל ואישור הרצת קוד חיצוני.

אם אין לכם גישה לשרת ייעודי עם מעבדי Blackwell בענן או בארגון, המודל הזה לא יעבוד אצלכם פיזית. במקרה כזה עדיף לצרוך את המודל דרך ספק API חיצוני במקום לנסות להשמיש חומרה יקרה שלא תומכת בפורמט הזה.

pip install -U huggingface_hub
hf download nvidia/DeepSeek-V4-Flash-NVFP4

הקבצים

76 קבצים במאגר, 157 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים שלכם, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗