GPT
D

DeepSeek-Coder-V2-Instruct-0724

קוד פתוח

deepseek-aiother2024-09-05

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל קוד ענק בתצורת תערובת מומחים שמתחרה ישירות במודלים מסחריים סגורים. הוא נותן חלון הקשר עצום של 128 אלף טוקנים ותמיכה במאות שפות תכנות.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 613הורדות בחודש

מה זה

מדובר בגרסת הוראות מעודכנת של מודל קוד מבוסס תערובת מומחים, עם 236 מיליארד פרמטרים בסך הכול, שמתוכם רק 21 מיליארד פעילים בכל טוקן. הוא אומן על בסיס צ'קפוינט ביניים עם תוספת של שישה טריליון טוקנים כדי לחזק מתמטיקה ותכנות בלי להרוס את יכולות השפה הכלליות. השוני המרכזי מול מה שהכרנו בגדלים האלה הוא שילוב של ארכיטקטורת מומחים עם תמיכה מוצהרת ב־338 שפות תכנות וחלון עיבוד של 128K טוקנים.

לפי מבחני הביצועים שהיוצרים מציגים, הוא עוקף מודלים סגורים כמו קלוד 3 אופוס, ג'מיני 1.5 פרו ו־GPT4 טורבו במשימות קידוד ומתמטיקה. המשמעות בפועל היא שהוא מיועד להבין מבני קוד סבוכים, לפתור אלגוריתמים מורכבים ולעבוד עם קבצים שלמים ולא רק לתפקד כהשלמה אוטומטית פשוטה. הגרסה הספציפית הזו כוללת תמיכה מובנית בהפעלת פונקציות חיצוניות ובפליטת אובייקטי JSON תקינים.

מתאים ל

  • השלמת קוד לפי הקשר רחב

    הוא תומך ב־FIM ומחזיק חלון של 128K, מה שמאפשר לו להבין קבצים שלמים ולהשלים קטעים באמצע פונקציה.

  • מימוש סוכני פיתוח אוטונומיים

    המודל כולל תמיכה מובנית ב־Function Calling ומאפשר להריץ כלים חיצוניים ולקבל החלטות על בסיס התוצאה.

  • בניית ממשקי API עם פלט JSON

    יש לו מצב ייעודי להחזרת תשובות במבנה JSON בלבד, שמונע שבירת מבנה בעבודה מול מערכות פנימיות.

איפה זה נופל

החיסרון המרכזי כאן הוא המשקל הפיזי והחומרה. 439 גיגה־בייט לחלוקה דורשים רוחב פס פנימי גבוה מאוד בין הכרטיסים, וכל ניסיון להריץ אותו על חומרה חלשה יותר יחייב קוונטיזציה אגרסיבית שתפגע בדיוק. בנוסף, למרות שהארכיטקטורה מפעילה רק 21 מיליארד פרמטרים ומקצרת זמני חישוב, כל המשקל עדיין חייב לשבת פיזית בזיכרון הגרפי.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על שרת ענן סטנדרטי עם GPU בודד?

לא. משקל המודל לבדו דורש מעל 400 גיגה־בייט זיכרון וידאו, מה שמחייב שמונה כרטיסי מסך של 80GB במקביל. לשרת בודד עדיף לבחור בגרסת ה־Lite או לגשת דרך ה־API.

במה הוא שונה מגרסת 0724 לעומת הגרסה הראשונה של Coder-V2?

הכרטיס מציג את 0724 כגרסת הוראות עדכנית של מודל ה־236B שנבנתה לאותו חלון הקשר ויכולות. היא מיועדת לעבודה ישירה בשיחה, קריאת כלים ויצירת JSON מדויק.

איך מריצים

להריץ את הדבר הזה עצמאית דורש משאבים כבדים מאוד. המודל שוקל 439 גיגה־בייט בפורמט bfloat16, וכדי להריץ אותו ככה להסקה צריך אשכול של שמונה כרטיסי מסך של 80 גיגה־בייט כל אחד. מריצים אותו בעזרת ספריית transformers או vLLM עם PR ייעודי.

לרוב המפתחים והצוותים אין שרת כזה זמין במשרד או בענן. במקרה כזה, עדיף להשתמש ב־API התואם ל־OpenAI שהחברה מציעה בתשלום לפי שימוש, או להסתפק בגרסת ה־Lite שמפעילה רק 2.4 מיליארד פרמטרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-Coder-V2-Instruct-0724")
print(pipe("שלום"))

הקבצים

65 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד בריפו מופץ תחת רישיון MIT, אך משקולות המודל כפופות להסכם רישוי ייעודי של החברה. הכרטיס מציין במפורש שהשימוש בגרסאות הבסיס וההוראות מאושר לשימוש מסחרי, אך יש לוודא את תנאי ההסכם המלאים לפני שילובו במוצר ייצורי.

הרישיון המלא בעמוד המודל ↗