GPT
D

DeepSeek-Coder-V2-Base

קוד פתוח

deepseek-aiother2024-06-14

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל בסיס פתוח לכתיבת קוד ופתרון מתמטיקה עם ארכיטקטורת מומחים ענקית. הוא מיועד למי שרוצה לאמן גרסה מותאמת אישית של כלי פיתוח חזק.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 3,023הורדות בחודש

מה זה

זהו מודל שפה שמבוסס על תערובת מומחים בהיקף של 236 מיליארד פרמטרים, כאשר בכל פעולה מופעלים רק 21 מיליארד. הוא אומן מנקודת ביניים של DeepSeek-V2 עם תוספת של שישה טריליון טוקנים, במטרה לשפר יכולות קידוד וחשיבה מתמטית. לפי המדידות של החברה, הביצועים שלו במשימות קוד ומתמטיקה עוקפים מודלים סגורים כמו GPT4-Turbo, Claude 3 Opus ו־Gemini 1.5 Pro.

המערך תומך ב־338 שפות תכנות ומחזיק חלון הקשר עצום, מה שמאפשר לו לקרוא קבצים ארוכים או פרויקטים שלמים. גרסת הבסיס הזו מספקת תשתית המשכית למחרוזות ולקטעי קוד, ולא ממשק שיחה מלוטש. השינוי המרכזי מול הדור הקודם הוא הרחבת התמיכה בשפות תכנות ושיפור הדיוק הלוגי.

מתאים ל

  • אימון מודל פנימי לארגון

    משמש נקודת מוצא מצוינת לכוונון עדין על מאגרי קוד פרטיים של חברות.

  • השלמת קוד והזרקת קטעים

    מתאים למנגנוני השלמה אוטומטית בזכות תמיכה מובנית במבנה של Fill-in-the-Middle.

  • ניתוח קבצי ענק ומערכי קוד

    מנצל חלון הקשר של 128 אלף טוקנים כדי לקרוא ספריות שלמות ברצף.

איפה זה נופל

מדובר במודל בסיס ולא בגרסת הוראות. הוא לא בנוי להגיב לשאלות בצורת צ׳אט אלא רק להשלים טקסט, כך שניסיון להשתמש בו ישירות כעוזר אישי יניב המשכי קוד אקראיים ולא תשובות ברורות. בנוסף, דרישות החומרה העצומות מייצרות עלויות שרתים כבדות שאינן מתאימות לרוב הפרויקטים הקטנים.

אותה משפחה

DeepSeek-Coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להשתמש בו ישירות כעוזר פיתוח בצ׳אט?

לא מומלץ. זו גרסת הבסיס שנועדה להשלמת טקסט ואימון נוסף, ולא עברה התאמה להוראות. לשיחה ועזרה שוטפת עדיף להוריד את גרסת ה־Instruct.

למה מודל של 236 מיליארד פרמטרים דורש פחות כוח חישוב בזמן ריצה?

הוא בנוי בארכיטקטורת תערובת מומחים. בכל טוקן פעילים רק 21 מיליארד פרמטרים מתוך הסך הכולל, מה שמאיץ את החישוב בפועל לעומת מודל רגיל באותו הגודל.

איך מריצים

כדי להריץ אותו בעצמכם בדיוק של bfloat16, תיעוד המודל דורש שמונה כרטיסי מסך של 80 גיגה בייט כל אחד. מדובר במשקל קבצים של 439 גיגה בייט, כך שציוד ביתי או שרת ענן צנוע לא יחזיקו אותו.

אם אין לכם שרת כזה, יש גרסת Lite קטנה בהרבה עם 16 מיליארד פרמטרים, או שעדיף לפנות ישירות ל־API שהחברה מציעה בתשלום לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-Coder-V2-Base")
print(pipe("שלום"))

הקבצים

65 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד עצמו מופץ תחת רישיון MIT, והמודל כפוף להסכם שימוש ייעודי של DeepSeek שמוגדר במערכת כרישיון אחר. החברה מציינת מפורשות שהסדרה תומכת בשימוש מסחרי, אך יש לעיין בתנאי ההסכם המלאים לפני הפצה במוצר מסחרי רחב.

הרישיון המלא בעמוד המודל ↗