GPT
D

DeepSeek-V3

קוד פתוח

deepseek-aiרישיון לא דווח2024-12-25

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

מודל ענק שמציג ביצועים ברמה של המודלים המובילים הסגורים, במיוחד בקוד ובמתמטיקה. הוא מפעיל רק חלק קטן מהמשקולות שלו בכל טוקן כדי לשמור על מהירות ועלויות ריצה שפויות.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 1,046,365הורדות בחודש

מה זה

מדובר במודל שפה בארכיטקטורת תערובת מומחים עם 671 מיליארד פרמטרים, כאשר בפועל מופעלים רק 37 מיליארד פרמטרים עבור כל טוקן. המשקל הכולל שמועלה להורדה מגיע ל־685 מיליארד פרמטרים בגלל מודול נוסף לחיזוי מרובה טוקנים. הוא אומן על 14.8 טריליון טוקנים ועבר זיקוק יכולות הסקת מסקנות מסדרת R1.

במבחני ביצועים הוא עוקף מודלים פתוחים כמו LLaMA 3.1 405B ומתחרה ראש בראש עם Claude 3.5 Sonnet ו־GPT-4o. היתרון הבולט שלו מגיע בקוד ובפתרון בעיות מתמטיות, עם תוצאות כמו 65.2 אחוזים ב־HumanEval וציון של 90.2 ב־MATH-500, לצד חלון הקשר שתומך בעד 128 אלף טוקנים לפי בדיקות השליפה.

מתאים ל

  • פיתוח כלי קוד והנדסת תוכנה

    מציג 82.6 אחוזים ב־HumanEval ומתעלה על רוב המודלים הפתוחים במשימות תכנות מורכבות.

  • פתרון בעיות מתמטיקה ומדע

    הזיקוק ממודל R1 מעניק לו תוצאה של 90.2 ב־MATH-500, מה שמסייע בחישובים והסקה לוגית.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים מאפשר לעבד קבצים גדולים במיוחד בבת אחת ללא קטיעה.

איפה זה נופל

למרות היכולות הגבוהות בקוד, המודל מפגין חולשה יחסית במענה על שאלות עובדתיות ישירות, עם ציון נמוך של 24.9 אחוזים בלבד במבחן SimpleQA לעומת המתחרים המובילים. בנוסף, מודול החיזוי המרובה עדיין נמצא בפיתוח בקהילה ולא נתמך במלואו בכל הכלים. המשקל העצום שלו, מעל 600 גיגה בייט המחולקים ל־185 קבצים, מקשה מאוד על תעבורה, גיבוי וזמני טעינה במערכות ייצור.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אני יכול להריץ את המודל הזה על תחנת עבודה יחידה?

לא. משקל הקבצים הוא 641 גיגה בייט, וכדי לטעון אותם צריך כמות עצומה של זיכרון גרפי. תצטרכו מערך מבוזר של 16 כרטיסי מסך לפחות, כמו שני שרתי שמונה כרטיסים כל אחד, ולכן מחשב אישי בודד לא יספיק.

האם המודל עובד ישירות דרך ספריית Transformers הרגילה?

נכון לעכשיו אין תמיכה ישירה בספרייה הזו לפי הודעת המפתחים. כדי להריץ אותו יש להשתמש בספריות תשתית ייעודיות כמו SGLang, vLLM, LMDeploy, או בקוד ההרצה שסופק במאגר.

איך מריצים

כדי להריץ אותו מקומית תצטרכו תשתית שרתים רצינית של כמה מכונות. דוגמת ההרצה הרשמית דורשת שני שרתים עם 8 כרטיסי מסך בכל אחד, כלומר 16 מאיצים בסך הכול, רק כדי להחזיק את 641 הגיגה בייט של המשקולות בזיכרון. המודל מסופק בפורמט FP8, ומי שרוצה BF16 יצטרך להמיר את המשקולות בעצמו באמצעות סקריפט ייעודי.

ספריות מובילות כמו SGLang, vLLM, LMDeploy ו־TensorRT-LLM כבר תומכות בו על כרטיסי אנבידיה, AMD ומעבדי Ascend של וואווי. ספריות Hugging Face Transformers עדיין לא תומכות בו ישירות. אם אין לכם אשכול שרתים ייעודי באלפי דולרים בחודש, עדיף להשתמש ב־API הרשמי שלהם.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V3")
print(pipe("שלום"))

הקבצים

185 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקולות המודל כפופות להסכם רישיון ייעודי בשם Model Agreement. לפי כרטיס המודל, השימוש בו מאושר לצרכים מסחריים הן בגרסת הבסיס והן בגרסת השיחה. עם זאת, בעמוד עצמו לא הוזן שדה רישיון סטנדרטי במטא־דאטה, ולכן מומלץ לקרוא את קובץ הרישיון המקורי במאגר לפני שילובו במוצר.

הרישיון המלא בעמוד המודל ↗