GPT
D

DeepSeek-V3-Base

קוד פתוח

deepseek-aiרישיון לא דווח2024-12-25

  • safetensors
  • deepseek_v3
  • custom_code
  • fp8

משקולות בסיס של מודל MoE ענקי עם 671 מיליארד פרמטרים, שמאקטב רק 37 מיליארד בכל טוקן. הבחירה המתאימה למי שבונה אימון המשך או התאמה ייעודית למשימות קוד ומתמטיקה בלי שכבת שיחה.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 3,683הורדות בחודש

מה זה

מדובר במודל בסיס שטרם עבר כוונון להוראות או שיחה. הוא מבוסס על ארכיטקטורת תערובת מומחים עם מנגנון Multi-head Latent Attention, ומאומן על 14.8 טריליון טוקנים. הגודל המלא על הדיסק כולל גם 14 מיליארד פרמטרים של רכיב חיזוי רב טוקנים שנועד להאצת הסקת מסקנות, כך שבפועל מורידים 685 מיליארד פרמטרים.

במבחני ביצועים של מודלי בסיס, הוא עוקף את LLaMA 3.1 405B במשימות קידוד עם ציון של 65.2 ב־HumanEval מול 54.9, ובמתמטיקה עם 61.6 ב־MATH מול 49.0. המשמעות היא יכולת פתרון בעיות לוגיות מורכבות ללא צורך בהנחיה מוקדמת, תוך חיסכון משמעותי במשאבי חישוב פר טוקן לעומת מודלים צפופים.

מתאים ל

  • אימון מודל מותאם אישית

    נקודת פתיחה חזקה מאוד לכוונון על נתונים ארגוניים פרטיים, בזכות ביצועי בסיס גבוהים במיוחד במתמטיקה ובקוד.

  • פיתוח כלי קידוד פנימיים

    ציון של 65.2 במבחן HumanEval הופך אותו לתשתית יעילה למערכות השלמת קוד אוטומטיות בארגונים גדולים.

  • מחקר והאצת הסקה

    רכיב החיזוי הרב טוקני המובנה מאפשר לבחון טכניקות של speculative decoding לקיצור זמני תגובה.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה. הוא לא יענה לשאלות כעוזר אישי אלא ימשיך את הטקסט שהזנתם, ולכן אי אפשר לחבר אותו ישירות לממשק משתמש של צ'אט בלי שלב של כוונון מונחה. בנוסף, ספריית Transformers הרגילה לא תומכת בו ישירות נכון לעכשיו, וחובה להמיר את המשקולות או להשתמש בסקריפטים ומנועים ספציפיים. תמיכת הקהילה ברכיב ה־MTP עדיין נמצאת בפיתוח פעיל, כך שלא כל התכונות עובדות מיידית בכל סביבה.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת יחיד עם כרטיס RTX 4090?

לא. משקל הקבצים לבדו עומד על 641 גיגה בייט בדיוק של FP8, כך ששרת בודד לא יכול להכיל אותו בזיכרון. הדרישה המינימלית היא מערך מרובה שרתים עם 16 כרטיסים ייעודיים לתשתיות בינה מלאכותית.

האם המודל מוכן לשימוש ישיר מול משתמשי קצה כצ'אטבוט?

לא, זו גרסת Base בלבד ולא גרסת Instruct או Chat. המודל רק משלים טקסט ולא אומן לעקוב אחר הוראות או לנהל שיחה, ולכן תצטרכו לאמן אותו בעצמכם או להשתמש בגרסת השיחה של DeepSeek-V3.

איך מריצים

משקל המודל בפורמט המקורי הוא 641 גיגה בייט ב־185 קבצים, והוא מגיע כמשקולות FP8 בלבד. כדי להריץ את גרסת ההדגמה הבסיסית צריך לפחות שני שרתים עם שמונה כרטיסי מסך כל אחד, כלומר 16 מאיצים חזקים כמו H800 כדי להחזיק את המודל במקביל. יש תמיכה במנועי הסקה כמו SGLang, vLLM ו־LMDeploy, וכן תמיכה בחומרת AMD ובמעבדי Ascend של וואווי.

אם אין לכם אשכול שרתים ייעודי עם חיבורי רשת מהירים במיוחד בין התחנות, אין טעם לנסות להרים אותו לבד בסביבה מקומית. לרוב המפתחים עדיף לגשת אליו דרך ה־API שהחברה מציעה, אלא אם כן אתם מחויבים רגולטורית להחזיק את כל המידע בתוך הרשת הפנימית או מתכננים אימון מקדים נוסף.

pip install -U huggingface_hub
hf download deepseek-ai/DeepSeek-V3-Base

הקבצים

185 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד Hugging Face לא דווח רישיון מוגדר, אך לפי כרטיס המודל הקוד עצמו מופץ תחת רישיון MIT ואילו השימוש במשקולות המודל כפוף להסכם ייעודי בשם Model License. המפתחים מציינים במפורש כי סדרת המודלים תומכת בשימוש מסחרי, אך לפני שילוב במוצר עסקי יש לבדוק את תנאי ההסכם המלאים של החברה.

הרישיון המלא בעמוד המודל ↗