GPT
D

DeepSeek-V2-Chat

קוד פתוח

deepseek-aiother2024-04-28

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל שיחה ענק שמפעיל רק חלק קטן מהמשקולות שלו בכל מילה, כדי לתת יכולות של מודלים מובילים בלי לחנוק את החומרה.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 20,988הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים עם 236 מיליארד פרמטרים בסך הכול, אך בכל רגע נתון פועלים רק 21 מיליארד פרמטרים. המבנה הזה, יחד עם דחיסת זיכרון ייעודית, מכווץ את הזיכרון הנדרש לשמירת ההקשר ב־93.3% ומעלה את קצב יצירת הטקסט פי כמה ביחס לגרסאות קודמות. הוא אומן על 8.1 טריליון טוקנים ועבר כוונון ייעודי לשיחה באמצעות חיזוקים.

במבחני ביצועים, המודל עוקף מתחרים פתוחים כמו מיקסטרל ולאמה 70B במשימות תכנות ומתמטיקה. בבדיקות קוד חי כמו LiveCodeBench הוא קיבל 32.5 נקודות, ובמבחן HumanEval הגיע ל־81.1%. בנוסף, חלון ההקשר שלו נבדק ונשאר יציב לאורך 128 אלף טוקנים, מה שמאפשר לו לנתח מסמכי ענק בלי לאבד פרטים.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים נבדק במלואו ומאפשר לחלץ מידע מדויק מקבצי ענק.

  • פיתוח כלי קוד

    ציונים של 81.1% ב־HumanEval ו־32.5 ב־LiveCodeBench הופכים אותו ליעיל בהשלמת קוד.

  • פתרון בעיות מתמטיות

    עם ציון של 92.2% ב־GSM8K, המודל מתאים לעיבוד נתונים מספריים וחישובים מורכבים.

איפה זה נופל

במשימות ידע כללי והבנה באנגלית המודל מציג ציונים נמוכים יותר מ־LLaMA3 70B, למשל 77.8 במבחן MMLU לעומת 80.3 של המתחרה. בנוסף, מדובר במודל שפותח עם דגש עצום על השפה הסינית, מה שמשתקף במבחני ההשוואה שלו, ואין בנתונים שום עדות ליכולת או דיוק כלשהם בעברית. לפני שמשלבים אותו במערכת מקומית, חובה לבדוק איך הוא מתמודד עם טקסטים מקומיים והוראות מורכבות בעברית.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת של כרטיס בודד?

לא בגרסה הזו. המודל שוקל 439 גיגה־בייט ודורש שמונה כרטיסים של 80 גיגה־בייט כדי לרוץ בדיוק המקורי. להרצה על חומרה קטנה יותר תצטרכו לחכות לגרסאות מכווצות או להשתמש ב־API.

האם עדיף להשתמש בו ישירות מול Hugging Face?

היוצרים עצמם מזהירים שהרצה דרך transformers אטית על המודל הזה. הם ממליצים לעבוד עם גרסה מותאמת של vLLM כדי לנצל את הארכיטקטורה שלו ולקבל קצב יצירה מהיר.

איך מריצים

כדי להריץ אותו עצמאית בדיוק המקורי של bfloat16 צריך שרת עם שמונה כרטיסי מסך של 80 גיגה־בייט כל אחד. המשקל הכולל של הקבצים מגיע ל־439 גיגה־בייט, כך שתשתית כזאת דורשת השקעה כבדה בברזלים או שכירות יקרה מאוד בענן.

המפתחים עצמם מציינים שהרצה ישירה דרך ספריית transformers איטית למדי, וממליצים להשתמש בפתרון ייעודי דרך vLLM. עבור רוב הצוותים, אלא אם המידע חייב להישאר פיזית בתוך הרשת המקומית מטעמי אבטחה מחמירים, עדיף בהרבה לפנות ישירות ל־API שהם מציעים.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2-Chat")
print(pipe("שלום"))

הקבצים

66 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקולות המודל כפופות להסכם שימוש ייעודי של החברה. ההסכם מאפשר שימוש מסחרי, אך כולל תנאים והגבלות ספציפיים שכדאי לקרוא לעומק במסמך המקורי לפני שמפיצים מוצר שמבוסס עליו.

הרישיון המלא בעמוד המודל ↗