GPT
D

deepseek-coder-6.7b-base

קוד פתוח

deepseek-aiother2023-10-23

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

מודל בסיס ייעודי לקוד שאומן מאפס על שני טריליון טוקנים. הוא מספק חלון הקשר של 16 אלף טוקנים ותמיכה בהשלמת קוד באמצע קובץ.

  • 6.7Bפרמטרים
  • 16,384טוקנים בהקשר
  • 25.1 GBמשקל הקבצים
  • 65,566הורדות בחודש

מה זה

מדובר במודל בסיס שמיועד נטו ליצירה והבנה של קוד, עם חלוקה של שמונים ושבעה אחוז קוד ורק שלושה עשר אחוז שפה טבעית באנגלית ובסינית. הוא משתמש בארכיטקטורת Llama רגילה עם 32 שכבות ומנגנון Multi-Head Attention, כך שהשילוב שלו בתשתיות קיימות של transformers עובד בלי התאמות מיוחדות.

היתרון המרכזי כאן מול מודלים כלליים בגודל הזה הוא האימון על משימות השלמה מבוססות פערים. אפשר לתת לו קטע קוד עם חור באמצע, והוא יודע לייצר את החלק החסר תוך התחשבות במה שמופיע לפניו ואחריו, ולא רק להמשיך טקסט קדימה. בנוסף, חלון ההקשר שלו מגיע ל־16,384 טוקנים, מה שמאפשר להזין קבצים שלמים או חלקים נרחבים מפרויקט בלי לחתוך אותם מראש.

מתאים ל

  • השלמת קוד בעורך

    המודל אומן על משימת השלמת פערים ומאפשר להשלים פונקציות ישירות מתוך ההקשר של הקובץ.

  • ניתוח קבצים ארוכים

    חלון של 16K טוקנים מתאים להזנת מודולים שלמים לצורך יצירת בדיקות יחידה.

  • בסיס לאימון פנימי

    מתאים לכיוונון עדין על בסיס קוד ארגוני פרטי בלי להתחיל אימון מאפס.

איפה זה נופל

זהו מודל בסיס ולא מודל שעבר כיוונון להוראות או לצ'אט. אם תתנו לו הנחיה כמו תסביר לי את הקוד הוא פשוט ינסה להמשיך את הטקסט או לייצר קוד נוסף, ולא באמת יענה לכם כמו עוזר אישי. בנוסף, האימון הטקסטואלי שלו הוגבל לאנגלית ולסינית בלבד, כך שלא כדאי לבנות עליו להבנה או כתיבה של הערות ותיעוד בעברית.

אותה משפחה

deepseek-coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל מתאים לשיחה כמו צ'אטבוט לפיתוח?

לא. זו גרסת הבסיס ולא גרסת Instruct. הוא לא מחזיר תשובות מנוסחות להנחיות אלא משלים רצפי קוד, ולכן לשיחה עדיף לחפש גרסה שעברה אימון ייעודי לכך.

האם אפשר להריץ אותו ישירות דרך ספריית transformers?

כן, הוא נתמך ישירות עם AutoModelForCausalLM. צריך רק להגדיר תמיכה בקוד מרוחק כדי לטעון את הטוקנייזר והמודל כראוי.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־25.1 גיגה בייט בדיוק של bfloat16. כדי לטעון ולהריץ אותו כמו שהוא בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי, במיוחד אם מנצלים את מלוא חלון ההקשר של ה־16K.

אם אין לכם חומרה כזו מקומית או בשרת ייעודי, הקמה ותחזוקה של מופע ענן בשבילו תעלה לא מעט. במצב כזה, פנייה ל־API חיצוני עשויה לחסוך התעסקות, אלא אם אתם חייבים שהקוד יישאר מקומית מטעמי אבטחה ופרטיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-coder-6.7b-base")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית של הפרויקט, אך המפתחים מציינים במפורש שהוא מאפשר שימוש מסחרי בכפוף לתנאי רישיון המודל שלהם. קוד המאגר עצמו מופץ תחת רישיון MIT. לפני הטמעה במוצר מסחרי צריך לבדוק את קובץ הרישיון המלא במאגר שלהם כדי לוודא שאין שם מגבלות שימוש ספציפיות.

הרישיון המלא בעמוד המודל ↗