GPT
D

DeepSeek-V4-Flash-0731-NVFP4

קוד פתוח

nvidiamit2026-08-19

  • Model Optimizer
  • safetensors
  • deepseek_v4
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של מודל ענק שפותחה במיוחד עבור חומרת Blackwell ומאפשרת להריץ הסקת מסקנות מהירה עם חלון של מיליון טוקנים.

  • 304Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 164 GBמשקל הקבצים
  • 3,952הורדות בחודש

מה זה

מדובר במודל שפה מסוג תערובת מומחים בהיקף של 304 מיליארד פרמטרים, שמתוכם רק 13 מיליארד מופעלים בכל טוקן נתון. אנבידיה לקחה את המשקולות המקוריות של דיפסיק, שנועדו במקור לפורמט MXFP4, והמירה אותן לפורמט NVFP4 תוך שמירה על משקולות הליבה והתאמת סקלות הבלוקים בלבד. המבנה משלב מנגנוני קשב דחוסים וייעודיים, יחד עם תמיכה ברמות מאמץ שונות של חשיבה ופלט מובנה.

בבדיקות הביצועים שפורסמו, גרסת ה־NVFP4 שומרת כמעט במדויק על רמת הדיוק של מקור ה־MXFP4. במבחן GPQA Diamond לתחומים מדעיים ברמת תואר מתקדם נרשם ציון זהה של 91.5, ובמבחן שירות הלקוחות הטלפוני τ²-Bench Telecom נרשמה ירידה קלה מ־98.7 ל־97.9. במשימות מסוף מורכבות כמו Terminal-Bench v2.1 הציון ירד מ־74.7 ל־73.7, בעוד שבכתיבת קוד מדעי נרשמה דווקא עלייה קטנה ל־52.1.

מתאים ל

  • סוכני שורת פקודה ופיתוח

    מתאים לביצוע אוטונומי של פקודות שלל, תכנון משימות והרצת קוד שנבדקו ב־Terminal-Bench v2.1.

  • ניתוח טקסטים ארוכים

    מיועד לשליפת נתונים מדויקת מתוך מסמכים ארוכים בזכות חלון של מיליון טוקנים ותוצאות AA-LCR.

  • הפעלת כלים ו־JSON

    תומך בחילוץ מבני, קריאות לפונקציות ואינטראקציה מול מערכות חיצוניות בדיוק גבוה.

איפה זה נופל

המודל אומן על נתונים גולמיים מהרשת שכוללים הטיות ושפה פוגענית, ובכרטיס מצוין בבירור שהוא עלול לייצר תשובות לא מדויקות, להחסיר פרטים קריטיים או לפלוט תוכן חברתי לא הולם גם כששואלים שאלה תמימה לחלוטין. מעבר לכך, מנגנון הפיענוח הספקולטיבי DSpark שנכלל במשקולות לא נבדק רשמית על קובץ ה־NVFP4 הזה, ואנבידיה מזהירה שלא להפעיל אותו בפרודקשן לפני שאתם מוודאים שהוא יציב בעצמכם.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי Hopper כמו H100?

לא. תאימות המיקרו־ארכיטקטורה המוגדרת בכרטיס המודל היא עבור NVIDIA Blackwell בלבד, והבדיקות בוצעו על שרתי B200. הרצה על חומרה מדור קודם אינה נתמכת בהגדרות אלו.

מדוע הקבצים שוקלים 164 גיגה בייט אם המודל עבר קוונטיזציה?

המשקולות המקוריות הגיעו מראש בדחיסת MXFP4. המעבר ל־NVFP4 שמר על אותן משקולות אך הכפיל את נפח הסקלות לכל בלוק, ולכן המשקל הכולל לא הצטמצם אלא מעט גדל.

האם המודל כולל תמיכה במנגנון חשיבה מובנה?

כן, המודל תומך בצינור קידוד ייעודי עם שלוש רמות מאמץ חשיבה, ומחזיר תוכן חשיבה מפורט כאשר הרכיב מופעל בהגדרות ההרצה של מנוע ההסקה.

איך מריצים

המודל הזה נתמך במפורש רק על ארכיטקטורת Blackwell של אנבידיה, עם תאימות חומרה שנבדקה על שרתי B200. כדי להרים מופע עצמאי עם SGLang או vLLM אתם חייבים מערך של שמונה מעבדים גרפיים במקביל, כפי שמוגדר בפקודות ההרצה הרשמיות, יחד עם שימוש במטמון FP8 כדי לעמוד בנפחי הזיכרון.

אם אין לכם אשכול שרתים פיזי מבוסס Blackwell, אין מה לנסות להריץ את המשקולות האלה מקומית. הקבצים שוקלים 164 גיגה בייט ומיועדים לתשתיות ייעודיות בלבד, כך שעבור רוב הצוותים פנייה לנקודת קצה מנוהלת דרך ספק ענן תהיה הדרך השפויה היחידה לצרוך אותו.

pip install -U huggingface_hub
hf download nvidia/DeepSeek-V4-Flash-0731-NVFP4

הקבצים

75 קבצים במאגר, 164 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא שאתם רשאים להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להטמיע אותו במוצרים שלכם ולהפיץ אותו בחופשיות, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗