GPT
D

deepseek-coder-33b-base

קוד פתוח

deepseek-aiother2023-10-28

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

בסיס חזק להשלמת קוד עם חלון של 16K טוקנים, שמתאים למי שרוצה לאמן או להריץ מודל פיתוח מקומי בגודל מלא בלי תלות בענן חיצוני.

  • 33Bפרמטרים
  • 16,384טוקנים בהקשר
  • 124 GBמשקל הקבצים
  • 1,794הורדות בחודש

מה זה

מדובר במודל בסיס של 33 מיליארד פרמטרים שאומן מאפס על שני טריליון טוקנים, כאשר רוב מוחלט מהמידע הוא קוד מקור והשאר טקסט באנגלית ובסינית בלבד. הוא בנוי בארכיטקטורת Llama עם Grouped-Query Attention ומגיע עם תמיכה מובנית במשימות השלמת קוד ומילוי קטעים חסרים באמצע הקובץ.

היתרון המרכזי כאן מול מודלים פתוחים אחרים בגודל דומה הוא חלון ההקשר. טווח של 16K טוקנים מאפשר להזין קבצים שלמים ואפילו כמה קבצים מאותו פרויקט בלי לחתוך שורות באמצע. במבחנים סטנדרטיים כמו HumanEval ו־MBPP המפתחים מדווחים על ביצועים מובילים בקטגוריית הקוד הפתוח, מה שאומר שהוא מייצר פתרונות אלגוריתמיים מדויקים יותר מרוב החלופות החופשיות.

מתאים ל

  • השלמת קוד בפרויקטים שלמים

    חלון של 16K ומנגנון מילוי חסרים מאפשרים להשלים פונקציות מורכבות על בסיס קבצים מלאים.

  • אימון מודל קוד פנימי לחברות

    גרסת בסיס גדולה שמתאימה לביצוע Fine-tuning על מאגרי קוד פרטיים בלי דליפת מידע החוצה.

  • מילוי קטעי קוד חסרים

    אימון ייעודי למשימות Infilling מאפשר להכניס לוגיקה חדשה בין מקטעי קוד קיימים.

איפה זה נופל

זהו מודל בסיס ולא מודל צ'אט שעבר כוונון להוראות. אם תתנו לו פקודה כמו תסביר לי את הפונקציה, הוא עלול פשוט להמשיך לכתוב שורות קוד במקום לענות. הוא מיועד בעיקר להשלמת קוד והשלמת חורים בתוך תחביר קיים.

בנוסף, הטקסט הטבעי באימון הוגבל לאנגלית ולסינית. בעברית אין לו שום הבנה מובנית, כך שהערות בקוד או תיעוד בשפה המקומית ישברו אותו לגמרי. נדרש כוונון נוסף כדי להפוך אותו לעוזר פיתוח שמתקשר בצורה חופשית.

אותה משפחה

deepseek-coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כעוזר צ'אט לפיתוח?

לא מומלץ. זהו מודל בסיס שממשיך רצף טקסט או קוד, ולא עבר תהליך של התאמה לשיחה. בשביל צ'אט עדיף לבחור בגרסת ה־Instruct של אותה סדרה.

האם המודל תומך בהערות או תיעוד בעברית?

לא. המודל אומן על קוד לצד אנגלית וסינית בלבד. שימוש בעברית בתוך הקוד יגרור פגיעה קשה בדיוק ולעיתים קרובות פלט משובש לחלוטין.

איך מריצים

כדי להריץ אותו צריך חומרה כבדה מאוד. המשקל הכולל של הקבצים מגיע ל־124 גיגה-בייט בפורמט bfloat16, כך שכרטיס מסך ביתי בודד פשוט לא יחזיק אותו בלי קוונטיזציה אגרסיבית. בסביבת ייצור נדרש שרת עם שני כרטיסי A100 של 80 גיגה לפחות כדי לקבל זמני תגובה שפויים.

ההרצה עצמה נעשית דרך ספריית transformers הרגילה בפייתון עם קריאה ל־trust_remote_code. אם אין לכם תשתית כזאת זמינה בענן או במשרד, עדיף להשתמש ב־API מנוהל או לבדוק את הגרסאות המוקטנות של הסדרה, כמו 6.7B, שדורשות פחות משאבים באופן משמעותי.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-coder-33b-base")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other בכרטיס, אך המפתחים מציינים שהקוד ב־MIT ושימוש במודל עצמו כפוף לתנאי הרישיון הייעודי שלהם. הרישיון מאפשר שימוש מסחרי, אך כולל תנאים והגבלות ספציפיים שמופיעים במסמך המקורי במאגר שלהם, ולכן מומלץ לבדוק אותו לפני שילוב ישיר במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗