GPT
D

DeepSeek-R1-NVFP4

קוד פתוח

nvidiamit2025-02-21

  • safetensors
  • deepseek_v3
  • text-generation
  • conversational
  • custom_code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת בדיוק FP4 של מודל ההסקה DeepSeek R1, שמיועדת לספק ביצועים כמעט זהים למקור תוך חיתוך צריכת הזיכרון בשרתי Blackwell.

  • 397Bפרמטרים
  • 163,840טוקנים בהקשר
  • 395 GBמשקל הקבצים
  • 1,979הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה רשמית של אנבידיה עבור DeepSeek R1, שדוחסת את המשקולות והאקטיבציות של השכבות הליניאריות ל־4 ביט באמצעות TensorRT Model Optimizer. הקובץ שוקל כ־395 גיגה-בייט, ומציע חלון הקשר של עד 128 אלף טוקנים בתוך סביבת ההרצה.

התוצאות במבחנים מראות שהכיווץ כמעט לא פגע ביכולות. ב־MMLU המודל מקבל 90.7 לעומת 90.8 בגרסת FP8, ב־GSM8K הוא עומד על 96.1 לעומת 96.3, ובמבחן AIME2024 אין שום ירידה והוא שומר על 80.0 בדיוק. הירידה הבולטת ביותר היא במבחן MATH-500, מ־95.4 ל־94.2, פער קטן שמעיד שהיכולת המתמטית והאנליטית נשמרה היטב למרות הדחיסה המשמעותית.

מתאים ל

  • פתרון בעיות מתמטיות

    שומר על ציון של 80.0 במבחן AIME2024 ומתאים למשימות הוכחה ואלגוריתמיקה מורכבות.

  • הסקה לוגית בשרתי Blackwell

    מנצל את ארכיטקטורת B200 להרצת מודל ענק עם חיסכון של פי 1.6 בזיכרון.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר של עד 128K טוקנים לקריאה והשוואה של טקסטים נרחבים.

איפה זה נופל

המגבלה הקשה ביותר היא התלות המוחלטת בחומרה ספציפית: המודל תומך בארכיטקטורת Blackwell בלבד ונבדק על B200, כך שכרטיסים מהדורות הקודמים כמו H100 או A100 אינם רלוונטיים עבורו. בנוסף, נתוני הכיול לדחיסה התבססו על מערך cnn_dailymail, טקסט חדשותי באנגלית, כך שאין שום נתונים על השפעת הקוונטיזציה על שפות אחרות כמו עברית. במבחני מתמטיקה מורכבים כמו MATH-500 יש איבוד דיוק קל, שמחייב בדיקה של התוצאות אם אתם בונים מערכת שמסתמכת על חישובים רגישים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שמונה כרטיסי H100?

לא. התאימות ברמת המיקרו-ארכיטקטורה מוגדרת ישירות ל־NVIDIA Blackwell בלבד, וההרצה נבדקה ונתמכת על כרטיסי B200. כרטיסים מדורות קודמים אינם תומכים בפורמט ה־FP4 הספציפי שמומש כאן.

כמה זיכרון נחסך בפועל לעומת גרסת FP8?

דחיסת המשקולות והאקטיבציות מ־8 ל־4 ביט מפחיתה את נפח האחסון בדיסק ואת דרישות זיכרון ה־GPU בערך פי 1.6, תוך שמירה על ביצועים כמעט זהים במבחני ההסקה.

איך מריצים

כדי להריץ את המודל אתם צריכים שרת לינוקס עם שמונה מעבדים גרפיים מסוג NVIDIA Blackwell B200, יחד עם TensorRT-LLM שנבנה ישירות מקוד המקור בענף הראשי שלו. מנוע ההרצה הנתמך היחיד הוא TensorRT-LLM, וההרצה מבוצעת עם מקביליות טנזורים של שמונה כרטיסים.

אם אין לכם אשכול B200 פיזי בחווה או בענן, אין שום דרך להריץ את הקבצים האלה מקומית. עבור רוב המפתחים שאינם מחזיקים בתשתית חומרה כזו, פנייה ל־API חיצוני שמארח את המודל היא הברירה המעשית היחידה.

pip install -U huggingface_hub
hf download nvidia/DeepSeek-R1-NVFP4

הקבצים

90 קבצים במאגר, 395 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד והמשקולות, ולהטמיע אותו במוצרים סגורים. הדרישה היחידה היא לכלול את הודעת זכויות היוצרים וכתב הוויתור המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗