GPT
D

DeepSeek-Coder-V2-Instruct

קוד פתוח

deepseek-aiother2024-06-14

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל קוד ענק בארכיטקטורת מומחים שמתחרה בביצועים של מודלים סגורים מובילים. הוא תומך ב־338 שפות תכנות ומחזיק חלון הקשר עצום, במטרה לפתור בעיות פיתוח מורכבות.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 10,155הורדות בחודש

מה זה

המודל אומן בהמשך לצ'קפוינט של DeepSeek-V2 עם תוספת של שישה טריליון טוקנים, בדגש על משימות תכנות והסקה מתמטית בלי לפגוע ביכולות שפה כלליות. המבנה שלו מבוסס על תערובת מומחים עם 236 מיליארד פרמטרים בסך הכול, אבל רק 21 מיליארד מהם פעילים בכל טוקן נתון. זה מאפשר לו להציע עומק הבנה וביצועים שמתחרים ישירות בפתרונות סגורים דוגמת GPT4-Turbo או Claude 3 Opus במבחני תוכנה ומתמטיקה.

בניגוד לגרסאות מוקדמות של החברה שתמכו ב־86 שפות, כאן יש כיסוי של 338 שפות תכנות. חלון ההקשר הורחב משמעותית ל־128 אלף טוקנים בכרטיס המודל, ובמטא-דאטה מוגדר עד 163,840 טוקנים, מה שמאפשר לו לעבד תיקיות פרויקט שלמות או מסמכי ארכיטקטורה ארוכים בלי לאבד את הקשר הדיון.

מתאים ל

  • ניתוח בסיסי קוד גדולים

    הקשר של מעל 128 אלף טוקנים מאפשר להזין ספריות שלמות לאיתור באגים ותלויות.

  • פיתוח בשפות נישתיות

    תמיכה ב־338 שפות תכנות שונות מאפשרת עבודה עם שפות שרוב המודלים בקושי מכירים.

  • השלמת קוד והזרקה באמצע קובץ

    תמיכה ייעודית בפורמט Fill-in-the-Middle מאפשרת השלמה מדויקת בתוך בלוק קיים.

איפה זה נופל

החיסרון הברור ביותר הוא דרישת החומרה הקיצונית, שהופכת כל ניסיון הרצה עצמי לפרויקט תשתיות יקר ומסורבל. מעבר לזה, המודל דורש הפעלת trust_remote_code בספריית transformers כדי לעבוד עם הארכיטקטורה הייעודית, מה שמחייב זהירות בהרצת קוד צד שלישי בסביבות מאובטחות.

למרות הביצועים הגבוהים במבחני קידוד ומתמטיקה, הוא אומן בראש ובראשונה למשימות תוכנה, ולכן במשימות שפה טהורות שאינן טכניות הוא לא מציג יתרון מובהק על פני מודלים כלליים.

אותה משפחה

DeepSeek-Coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל המלא על שרת עם כרטיס GPU בודד?

לא. המודל שוקל 439 גיגה-בייט ב־bfloat16 ודורש לפחות שמונה כרטיסי מסך של 80 גיגה-בייט להרצה מקומית. אם יש לכם שרת קטן, עדיף להשתמש בגרסת ה־Lite או לפנות למודל דרך ה־API.

מה היתרון של ארכיטקטורת המומחים במודל הזה?

מתוך 236 מיליארד פרמטרים סך הכול, רק 21 מיליארד מופעלים בכל חישוב. המבנה הזה נותן יכולות של מודל ענק תוך חיסכון בזמן חישוב בזמן היסק, אם כי דרישות זיכרון ה־VRAM עדיין נשארות עצומות כדי להחזיק את כל המשקלים.

האם יש תמיכה ישירה בעברית?

המודל אומן והותאם בעיקר למשימות קידוד, מתמטיקה ושפות תכנות בינלאומיות. הוא יבין הוראות בסיסיות בעברית כמו מודלים גדולים אחרים, אבל הוא לא מותאם במיוחד ליצירת טקסט עברי שוטף או מדויק.

איך מריצים

המשקל הכולל של הקבצים עומד על כ־439 גיגה-בייט בפורמט bfloat16 על פני 65 קבצים. כדי להריץ אותו מקומית בתצורה הזו, היצרן מציין במפורש שצריך מערך של שמונה כרטיסי מסך בנפח 80 גיגה-בייט כל אחד. מריצים אותו דרך ספריית transformers של פייתון או דרך vLLM עם התאמות קוד ספציפיות.

למי שאין שרת ייעודי בעלות של עשרות אלפי שקלים בחודש, הרצה עצמית בפורמט המלא פשוט לא מעשית. ברוב המקרים עדיף להשתמש ב־API של היוצרים בתשלום לפי שימוש, או לפנות לגרסת ה־Lite הקטנה יותר שכוללת 16 מיליארד פרמטרים ודורשת משאבים צנועים בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-Coder-V2-Instruct")
print(pipe("שלום"))

הקבצים

65 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד בריפו מופץ תחת רישיון MIT, אך משקלי המודל עצמם כפופים להסכם ייעודי בשם Model License של החברה, שמסומן במערכת כ־other. היצרן מאשר שימוש מסחרי במודל ובגרסאות ההמשך שלו, אך מי שמתכנן להטמיע אותו במוצר חייב לקרוא את מסמך הרישיון המלא כדי לוודא עמידה במגבלות ההפצה והשימוש.

הרישיון המלא בעמוד המודל ↗