GPT
D

DeepSeek-V2

קוד פתוח

deepseek-aiother2024-04-22

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל שפה מבוסס תערובת מומחים שמפעיל 21 מיליארד פרמטרים בלבד מתוך 236 מיליארד לכל טוקן. המבנה הזה נותן מהירות תגובה גבוהה וביצועים תחרותיים בחישוב ובקוד.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 39,072הורדות בחודש

מה זה

הארכיטקטורה כאן נשענת על MoE עם 236 מיליארד פרמטרים כוללים, אבל רק 21 מיליארד מהם מופעלים בזמן אמת עבור כל טוקן. המפתחים שילבו מנגנון תשומת לב בשם Multi-head Latent Attention שמכווץ את זיכרון ה־KV ב־93.3 אחוז, מה שמוריד משמעותית את העומס בזיכרון הריצה ומעלה את קצב פליטת הטוקנים פי 5.76 לעומת הדור הקודם של החברה.

במבחני ביצועים, גרסת הבסיס מגיעה לתוצאה של 78.5 ב־MMLU באנגלית ו־43.6 במבחן Math, שזה קרוב מאוד ל־LLaMA 3 70B ומנצח אותו במתמטיקה. החוזק הבולט ביותר מופיע במשימות בשפה הסינית, עם 81.7 במבחן C-Eval ו־84 ב־CMMLU, פער ניכר מעל מודלים מערביים מקבילים.

מתאים ל

  • עיבוד טקסטים ארוכים בסינית

    הוא מציג ציונים גבוהים של מעל 81 במבחני שפה סינית ותומך בהקשר רחב של עד 128 אלף טוקנים.

  • בסיס לאימון מודלים ארגוניים

    ארכיטקטורת ה־MoE חוסכת זיכרון ומאפשרת אימון המשך על נתונים פנימיים עם 236 מיליארד פרמטרים.

  • פתרון בעיות מתמטיקה

    עם ציון של 43.6 במבחן Math, הוא מתחרה היטב במודלים בקטגוריית גודל זו במשימות אנליטיות.

איפה זה נופל

למרות ההבטחה לחלון הקשר של 128 אלף טוקנים שנבדק במבחני מחט בערימת שחת, המודל פחות מתאים למי שאינו מאומן בתשתיות כבדות. מעבר לחומרה המפלצתית הנדרשת, מדובר במודל בסיס שאינו כולל כוונון שיחה או יישור בטיחות, ולכן הוא ידרוש אימון נוסף או שימוש בגרסת ה־Chat. בנוסף, היתרון העיקרי שלו נרשם במבחנים בסינית, בעוד שבמדדי קוד כמו HumanEval הוא מקבל 48.8, תוצאה סבירה אך נמוכה מ־Mixtral 8x22B.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי חזק?

לא. משקל הקבצים עומד על 439 גיגה בייט והוא דורש שמונה מאיצים גרפיים של 80 גיגה בייט כל אחד כדי לפעול בדיוק המלא שלו.

האם כדאי לבחור בו על פני גרסת ה־Chat?

זהו מודל בסיס להשלמת טקסטים בלבד. אם המטרה היא דיאלוג, מענה לשאלות או סוכן שיחה, עדיף להוריד ישירות את גרסת DeepSeek-V2-Chat.

איך מריצים

כדי להריץ אותו ישירות בדיוק bfloat16 מלא, תצטרכו שרת עם שמונה כרטיסי מסך של 80GB, כלומר 640GB של זיכרון גרפי ייעודי. הקבצים עצמם שוקלים 439 גיגה בייט, כך שאי אפשר להפעיל אותו על שרת בודד צנוע או תחנת עבודה רגילה.

המפתחים ממליצים לעבוד דרך vLLM עם התאמה ספציפית ולא דרך Hugging Face transformers הרגיל, שעובד לאט יותר בגלל מבנה השכבות הייחודי. אלא אם יש לכם אשכול שרתים ייעודי שפועל מסביב לשעון, החלופה הזולה וההגיונית היא לשלוח שאילתות ל־API של DeepSeek שזמין במודל תשלום לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2")
print(pipe("שלום"))

הקבצים

66 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אך משקלי המודל עצמם כפופים להסכם רישוי ייעודי של המפתחים. ההסכם מאפשר שימוש מסחרי במודל הבסיס ובגרסת השיחה שלו, אך מחייב בדיקה של תנאי ההסכם המצורפים לגבי מגבלות הפצה ושימוש במוצרים.

הרישיון המלא בעמוד המודל ↗