GPT
D

DeepSeek-R1-0528-NVFP4

קוד פתוח

nvidiamit2025-06-03

  • Model Optimizer
  • safetensors
  • deepseek_v3
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת לפורמט FP4 של מודל ההסקה DeepSeek-R1. היא מאפשרת להריץ מודל ענק של 397 מיליארד פרמטרים על חומרת Blackwell בלי לאבד ביצועי מתמטיקה וקוד.

  • 397Bפרמטרים
  • 163,840טוקנים בהקשר
  • 395 GBמשקל הקבצים
  • 10,916הורדות בחודש

מה זה

מדובר בהמרה של DeepSeek-R1 לפורמט NVFP4 שבוצעה באמצעות ספריית Model Optimizer של אנבידיה. הכיווץ מוריד את המשקלים והאקטיבציות של השכבות הלינאריות מ־8 ביט ל־4 ביט, מה שמצמצם את תפיסת הזיכרון והאחסון פי 1.6 בערך.

במבחני הביצועים הירידה מול גרסת ה־FP8 כמעט בלתי מורגשת. ב־MMLU Pro הוא יורד מ־85 ל־84.2, ב־GPQA Diamond מ־81 ל־80, וב־LiveCodeBench מ־77 ל־76.3. במבחנים מתמטיים הוא אפילו רשם עליה קלה, עם 98.1 ב־MATH-500 ו־91.3 ב־AIME 2024 לעומת 89 ברפרנס. המודל שומר על יכולות חשיבה עמוקות ומיועד לעבודה עם TensorRT-LLM.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג 91.3 במבחן AIME 2024 ומתאים למערכות שדורשות חישוב והסקה מורכבת.

  • ניתוח וייצור קוד

    מגיע לתוצאה של 76.3 ב־LiveCodeBench עבור אוטומציות פיתוח ובדיקות תוכנה.

  • שרתי הסקה ב־Blackwell

    מותאם אישית לחומרת B200 להורדת זמני שיהוי וצמצום נפח זיכרון העבודה.

איפה זה נופל

בדומה למודל המקור, הוא אומן על נתונים גולמיים מהרשת ולכן עלול לייצר פלטים פוגעניים, לחזק הטיות או להמציא עובדות, גם כשהשאילתה נקייה לגמרי. כדי לקבל תוצאות טובות אנבידיה מנחה מפורשות לא להשתמש ב־system prompt, לקבוע טמפרטורה מדויקת בין 0.5 ל־0.7 כדי למנוע לולאות אינסופיות, ובבעיות חישוב להכריח אותו לענות שלב אחרי שלב בתוך תבנית ייעודית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי H100 או כרטיסים ישנים יותר?

ההסבה ל־FP4 נתמכת רשמית רק בארכיטקטורת Blackwell כמו מעבדי B200. כרטיסים מדורות קודמים לא תומכים בהאצת החומרה הנדרשת עבור הפורמט הזה ב־TensorRT-LLM.

איך צריך לנסח שאילתות כדי שהמודל יעבוד טוב?

ההנחיה היא לא לשים system prompt בכלל, אלא לרכז את כל ההוראות ישירות בפניית המשתמש. בנוסף, חובה להגדיר טמפרטורה באזור 0.6 כדי למנוע מהמודל לחזור על עצמו בלי סוף.

איך מריצים

כדי להריץ אותו מקומית צריך שרת עם שמונה כרטיסי B200 של אנבידיה בארכיטקטורת Blackwell ומערכת הפעלה לינוקס. ההרצה דורשת בנייה של TensorRT-LLM ישירות מהקוד העדכני ביותר, והקבצים לבדם שוקלים 395 גיגה-בייט שמחולקים ל־173 קבצים.

אם אין לכם אשכול B200 פנוי בחווה, אין מה לנסות להוריד אותו לשרת רגיל. במקרה כזה עדיף לחלוטין לצרוך את המודל דרך שירות ענן שמציע גישה ישירה ב־API במקום להשקיע בציוד שעולה הון.

pip install -U huggingface_hub
hf download nvidia/DeepSeek-R1-0528-NVFP4

הקבצים

173 קבצים במאגר, 395 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים משוחררים תחת רישיון MIT. מותר להשתמש בהם לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו בתוך מוצר, בלי תמלוגים או הגבלות שימוש מיוחדות, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗