GPT
D

DeepSeek-V2.5

קוד פתוח

deepseek-aiother2024-09-05

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

שילוב בין מודל שיחה כללי למודל קוד חזק יצר משקל כבד שמתאים למי שחייב יכולות תכנות גבוהות יחד עם מעקב קפדני אחרי הוראות טקסטואליות מורכבות.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 5,740הורדות בחודש

מה זה

הגרסה הזו מאחדת שני קווי פיתוח קודמים, DeepSeek-V2-Chat ו־DeepSeek-Coder-V2-Instruct, לכדי מודל יחיד עם 236 מיליארד פרמטרים. במקום להחזיק תשתית נפרדת למשימות שיחה ותשתית נפרדת לפיתוח תוכנה, הוא מרכז את שתי היכולות תחת ארכיטקטורה אחת עם חלון הקשר נרחב של 163,840 טוקנים.

במדדי ההערכה של היוצרים, הדגם מציג קפיצה ברורה בשיחה ובקוד לעומת קודמיו. ציון ArenaHard עלה ל־76.2 לעומת 68.3 ו־66.3 בגרסאות הקודמות, וציון HumanEval בפייתון הגיע ל־89 נקודות. המשמעות בפועל היא יכולת טובה יותר להבין כוונת משתמש עקיפה ולספק פתרונות תכנות מדויקים ישירות, לצד יכולות מובנות של קריאות לפונקציות, השלמת קוד באמצע קובץ והפקת פלט במבנה JSON תקני.

מתאים ל

  • השלמת קוד באמצע קובץ

    תמיכה מובנית במנגנון Fill In the Middle מאפשרת לו להשלים מקטעי קוד חסרים בין פונקציות קיימות.

  • אוטומציה עם קריאת פונקציות

    המודל מנתח בקשות טקסט ומחזיר מבני קריאה מדויקים לכלים חיצוניים יחד עם הפרמטרים הנדרשים.

  • חילוץ מידע לפלט JSON

    הגדרת מצב ייעודית בהנחיית המערכת מאלצת החזרת אובייקט JSON תקין ללא תוספות מסביב.

איפה זה נופל

למרות השיפורים ברוב המבחנים, יש נקודות שבהן המודל נסוג לעומת גרסת הקוד הייעודית שקדמה לו. במבחן SWE-verified הוא קיבל ציון של 16.8 לעומת 19 בגרסה הקודמת, מה שמעיד על ביצועים פחות יציבים בפתרון בעיות תוכנה אמורפיות במאגרי קוד קיימים. בנוסף, ציון HumanEval Multi ירד קלות מ־74.8 ל־73.8, כך ששפות תכנות פחות נפוצות עלולות להניב תוצאות פחות טובות מפייתון. חשוב לבדוק את התנהגותו עם תבנית השיחה החדשה, שאינה תואמת לגרסאות קודמות.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי מסך חזקים?

לא. המודל דורש לפחות 8 כרטיסים של 80GB כדי לעלות לזיכרון בפורמט bfloat16 המקורי. משקל הקבצים לבדו חוצה את ה־400 גיגה בייט.

האם תבנית הפנייה זהה לגרסאות קודמות של DeepSeek?

לא, תבנית השיחה עודכנה לעומת הגרסה הקודמת. יש להשתמש במבנה התגים החדש שמופיע בקובץ ההגדרות של המודל כדי לקבל תוצאות תקינות.

איך מריצים

כדי להריץ את המודל הזה בתצורת bfloat16 מלאה, צריך מערך שרתים ייעודי שכולל 8 מעבדי GPU עם 80GB זיכרון כל אחד. קבצי המשקולות עצמם שוקלים 439 גיגה בייט, כך שאי אפשר להתקין אותו על חומרה משרדית או מחשב מקומי טיפוסי.

אפשר להריץ אותו עם transformers של Hugging Face או דרך vLLM, שמחייב עדכון ספציפי מקוד המקור לפי הנחיות המפתחים. אם אין לכם אשכול מחשוב זמין בהיקף כזה, הרצה עצמאית תהיה יקרה ומסורבלת, ובמצב כזה עדיף לצרוך אותו דרך API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2.5")
print(pipe("שלום"))

הקבצים

65 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד בריפו מופץ תחת רישיון MIT, אך משקולות המודל עצמן כפופות להסכם רישוי ייעודי של DeepSeek המוגדר במטא-דאטה כ־other. המפתח מציין שסדרת הדגמים הזו תומכת בשימוש מסחרי, אך חובה לקרוא את תנאי ההסכם המצורף כדי לוודא שאין בו מגבלות הפצה שנוגעות למוצר שלכם.

הרישיון המלא בעמוד המודל ↗