GPT
D

deepseek-coder-1.3b-base

קוד פתוח

deepseek-aiother2023-10-28

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

מודל קוד קטן שרץ כמעט על כל כרטיס מסך בסיסי ומתאים להשלמת קוד מקומית. הוא אומן על טריליון טוקנים ותומך במשימות מילוי חסרים בתוך קבצים.

  • 16,384טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 27,106הורדות בחודש
  • 112לייקים

מה זה

מדובר במודל בסיס ייעודי לפיתוח תוכנה, שנבנה על ארכיטקטורת LlamaForCausalLM עם 24 שכבות. הוא אומן מאפס על טריליון טוקנים, כאשר החומר מורכב מרובו המוחלט מקוד, כשמונים ושבעה אחוזים, והשאר שפה טבעית באנגלית ובסינית בלבד. המבנה שלו כולל תמיכה מובנית במשימת מילוי חסרים, מה שמאפשר לו להבין לא רק מה נכתב לפני הסמן אלא גם מה מופיע אחריו בקובץ.

היתרון המרכזי כאן מול מודלים אחרים במשקל של ג'יגה וחצי פרמטרים הוא חלון ההקשר. המודל מסוגל לקבל עד 16,384 טוקנים, שזה טווח שמאפשר להזין קבצים שלמים או מספר קבצים מאותו פרויקט בלי לקטוע את הקוד באמצע. יוצרי המודל מדווחים על תוצאות מובילות במבחני קוד פתוח כמו HumanEval ו־MBPP, אבל מדובר במודל בסיס שמשלים תחביר ולא במודל צ'אט שמנהל שיחה או מסביר באגים.

מתאים ל

  • השלמת קוד בעורך

    מתאים לתוסף פיתוח מקומי שמציע שורות קוד תוך כדי הקלדה, בלי לשלוח מידע לרשת.

  • השלמת קוד אמצע

    יכולת מילוי החסרים המובנית מאפשרת להשלים פונקציה בדיוק ברווח שבין שאר חלקי הקובץ.

  • בסיס לאימון מקומי

    משקל קל שמאפשר לבצע כוונון עדין על בסיס קוד ארגוני פנימי בחומרה פשוטה יחסית.

איפה זה נופל

זהו מודל בסיס בלבד, לכן הוא לא מגיב לפקודות בשפה חופשית אלא פשוט מנחש את המשך הטקסט. הנתונים שלו כוללים אנגלית וסינית בלבד, כך שאין לצפות ממנו להבין הערות או תיעוד בעברית. בנוסף, מודל של 1.3 מיליארד פרמטרים מועד לטעויות לוגיות עדינות בקוד מורכב, ומחייב בדיקה ידנית מלאה של כל קטע שהוא מייצר לפני שמריצים אותו.

אותה משפחה

deepseek-coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יכול לשמש כצ'אט שמסביר שגיאות בקוד?

לא. מדובר בגרסת בסיס שמיועדת להשלמת טקסט ולא למענה על שאלות. אם תכתבו לו שאלה, הוא עשוי פשוט להמשיך להמציא עוד שאלות או קוד בלי לתת תשובה ישירה.

האם אפשר להשתמש במודל על קוד בעברית?

האימון כלל אך ורק אנגלית וסינית לצד שפות התכנות. הוא ידע לקרוא את התחביר של הקוד עצמו, אבל יתקשה מאוד להבין הערות, שמות משתנים או מחרוזות בעברית.

איך מריצים

המודל שוקל 2.5 גיגה בייט בלבד בדיוק bfloat16, כך שהוא נכנס בקלות לתוך זיכרון של כרטיס מסך ביתי זול עם 4 עד 6 גיגה זיכרון. טוענים אותו ישירות דרך ספריית transformers של פייתון עם הגדרת trust remote code, והוא רץ ישירות ב־CUDA ללא צורך בהגדרות מורכבות.

אם אתם צריכים עוזר קוד אינטראקטיבי או הסברים מורכבים, אין טעם להריץ את גרסת הבסיס הזו מקומית. במקרים כאלה עדיף לגשת לגרסאות גדולות יותר של 33 מיליארד פרמטרים דרך שירות חיצוני, או להשתמש בגרסת instruct שעברה כוונון ייעודי להוראות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-coder-1.3b-base")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמשטר רישוי ייעודי נפרד ולא כרישיון קוד פתוח תקני. המפתחים מציינים במפורש שהוא מאפשר שימוש מסחרי, אך מחייב בדיקה של תנאי הרישיון המלאים בקובץ הייעודי במאגר המקורי לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗