GPT
D

DeepSeek-V2-Lite-Chat

קוד פתוח

deepseek-aiother2024-05-15

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל שיחה בארכיטקטורת תערובת מומחים שכולל כמעט 16 מיליארד פרמטרים, אבל מפעיל בפועל רק 2.4 מיליארד לכל טוקן. הוא נותן ביצועים של מודל גדול יותר בעלות חישוב של מודל קטן.

  • 16Bפרמטרים
  • 163,840טוקנים בהקשר
  • 29.3 GBמשקל הקבצים
  • 166,056הורדות בחודש

מה זה

הארכיטקטורה כאן מחלקת את העבודה בצורה חריגה: יש 64 מומחים מנותבים ועוד 2 מומחים משותפים, ומתוכם רק 6 מומחים נכנסים לפעולה בכל שלב. הדחיסה הזו, יחד עם מנגנון קשב שמכווץ את זיכרון המפתח-ערך, נועדה לפתור את צוואר הבקבוק המוכר של שמירת היסטוריית השיחה.

במבחני ביצועים בסיסיים הוא עוקף מודלים צפופים של 7 מיליארד פרמטרים. במתמטיקה למשל, מבחן GSM8K מציג ציון של 72.0 מול 62.6 במודל הקודם של החברה, ובקוד הוא מגיע ל־57.3 במבחן HumanEval מול 45.1. המודל עבר אימון מסודר מראש על 5.7 טריליון טוקנים, ואחריו כוונון ייעודי לשיחה עם תבנית פרומפטים מוגדרת.

מתאים ל

  • בוט שיחה על שרת עצמאי

    דורש כרטיס של 40GB ומספק מענה קל ומהיר בזכות הפעלת 2.4 מיליארד פרמטרים בלבד.

  • עוזר פיתוח וכתיבת קוד

    מציג שיפור ניכר במבחני קוד עם ציון של 57.3 ב־HumanEval מול דורות קודמים.

  • פתרון בעיות חישוב ומתמטיקה

    קופץ ל־72.0 במבחן GSM8K ומציע יכולת ניתוח גבוהה משמעותית ממודלים בגודל דומה.

איפה זה נופל

למרות חלון ההקשר המדווח של 163,840 טוקנים במטא-דאטה, טבלת המודל בכרטיס מגדירה אורך הקשר של 32,000 טוקנים בלבד, פער שחובה לבדוק בפועל לפני שמסתמכים על מסמכים ענקיים. בנוסף, מנגנון הקשב הייחודי (MLA) דורש הרחבות קוד חיצוניות ומקשה על שילוב חלק בספריות שלא תומכות בו ישירות. במשימות תכנות מורכבות יותר, מבחן MBPP מציג ציון של 45.8, נמוך במעט מהדור הקודם שהשיג 46.2.

אותה משפחה

DeepSeek-V2-Lite יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי רגיל?

לא בלי כרטיס שרת ייעודי או קוונטיזציה. בגרסת המקור של bfloat16 הקבצים שוקלים 29.3GB ודורשים לפחות GPU עם 40GB זיכרון.

איך הכי מומלץ להריץ אותו בשרת פרטי?

היוצרים ממליצים להשתמש ב־vLLM עם ההתאמות הייעודיות שלהם. הרצה דרך transformers הסטנדרטית עובדת אבל מציגה ביצועים איטיים בהרבה.

איך מריצים

כדי להריץ אותו מקומית בפורמט bfloat16 מלא תצטרכו כרטיס מסך יחיד עם 40GB זיכרון. הקבצים עצמם שוקלים 29.3GB, כך שכרטיסי גיימינג סטנדרטיים של 16GB או 24GB לא יספיקו בלי קוונטיזציה. אם המטרה היא אימון נוסף או פיין-טיונינג מלא, הדרישה קופצת לחוות שרתים של 8 כרטיסים עם 80GB כל אחד.

היוצרים מציינים במפורש שהרצה ישירה דרך ספריית transformers תהיה איטית יותר מהתשתית הפנימית שלהם. לצורך עבודה יעילה בסביבת ייצור, עדיף להריץ אותו דרך vLLM שכולל התאמות מיוחדות לארכיטקטורה הזו, או לפנות לממשק ה־API הרשמי שלהם שתואם למבנה של OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2-Lite-Chat")
print(pipe("שלום"))

הרישיון

הקוד ברישיון MIT חופשי, בעוד משקלי המודל כפופים להסכם רישיון ייעודי של DeepSeek המוגדר במאגר כ־other. החברה מציינת מפורשות שהגרסה הזו מאושרת לשימוש מסחרי, אך חובה לפעול לפי תנאי ההסכם הספציפיים שהם צירפו לקבצים.

הרישיון המלא בעמוד המודל ↗