GPT
D

deepseek-coder-1.3b-instruct

קוד פתוח

deepseek-aiother2023-10-29

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

מודל קוד קטן שרץ כמעט על כל מחשב ומבין הוראות ישירות. הבחירה בו הגיונית כשצריך השלמת קוד מקומית ומהירה עם חלון הקשר נדיב בלי תלות בענן.

  • 1.3Bפרמטרים
  • 16,384טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 34,438הורדות בחודש

מה זה

מדובר במודל של 1.3 מיליארד פרמטרים שאומן מאפס על שני טריליון טוקנים, כאשר רוב מוחלט של החומר, שמונים ושבעה אחוזים, הוא קוד מקור והשאר שפה טבעית באנגלית ובסינית בלבד. גרסת ה־Instruct הזו עברה כוונון עדין על שני מיליארד טוקנים של הוראות, כך שהיא יודעת לענות ישירות לבקשות כמו כתיבת פונקציות או הסבר קוד ולא רק לנחש את השורה הבאה.

היתרון הבולט שלו מול מודלים זעירים אחרים הוא שילוב של משימות השלמת קטעים באמצע הקובץ יחד עם חלון הקשר של 16,384 טוקנים. זה אומר שאפשר להזין לו קבצים שלמים או מספר קבצים מאותו פרויקט בלי לחתוך את הקוד לחתיכות קטנות מדי, תכונה שלרוב שמורה למודלים כבדים בהרבה.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    משקל קל של חמישה גיגה-בייט מאפשר תגובה כמעט מיידית ישירות מהמחשב האישי בלי לשלוח קוד החוצה.

  • השלמת קטעים באמצע קובץ

    אומן במיוחד למשימות מילוי חסרים, מה שמתאים לעריכת פונקציות קיימות בתוך קובץ נתון.

  • יצירת בדיקות יחידה

    מבין הוראות ישירות ומסוגל לכתוב טסטים מוגדרים היטב לפונקציות בודדות באנגלית.

איפה זה נופל

מודל של 1.3 מיליארד פרמטרים מוגבל מאוד בהבנה של משימות מורכבות, והוא נוטה להמציא ספריות או להיכשל בלוגיקה עדינה כשמבקשים ממנו יותר מפונקציה ממוקדת. הוא אומן על אנגלית וסינית בלבד, כך שאי אפשר לצפות ממנו להבין שאלות בעברית או לייצר הערות קוד בעברית תקינה.

בנוסף, למרות שחלון ההקשר מגיע ל־16 אלף טוקנים, מודל קטן כזה מתקשה לשמור על תשומת לב מלאה לאורך כל הטקסט הארוך. אסור להכניס אותו למוצר בלי בדיקות אוטומטיות קפדניות על הפלט שהוא מייצר.

אותה משפחה

deepseek-coder יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל מבין הוראות שנכתבו בעברית?

לא. נתוני האימון כללו שפה טבעית באנגלית ובסינית בלבד, לצד שפות תכנות. פניות בעברית יובילו כנראה לג'יבריש או לסירוב להגיב, ולכן חובה לכתוב לו פרומפטים באנגלית.

האם אפשר להריץ אותו בלי כרטיס מסך ייעודי?

כן, משקל הקבצים עומד על חמישה גיגה-בייט ולכן אפשר להריץ אותו ישירות על זיכרון המעבד ברוב המחשבים המודרניים. הביצועים יהיו איטיים יותר מאשר על כרטיס מסך, אך עדיין שמישים למשימות פשוטות.

איך מריצים

חמשת הגיגה-בייט של המשקלים נכנסים בקלות לזיכרון של כרטיס מסך בסיסי או למעבד של מחשב נייד מודרני, בהרצה ישירה עם ספריית transformers ודיוק bfloat16. הקוד דורש הפעלת trust_remote_code בזמן הטעינה ומייצר תשובות דרך תבנית צ'אט מובנית.

אם כל מה שאתם צריכים זה השלמת קוד שוטפת בתוך סביבת הפיתוח או בדיקות אוטומטיות מקומיות, החומרה הביתית תספיק לחלוטין. אם המשימה שלכם דורשת ארכיטקטורת מערכת שלמה או לוגיקה עסקית סבוכה במיוחד, שום אופטימיזציה מקומית לא תפצה על הגודל, ועדיף לשלוח קריאה למודלים ענקיים דרך ממשק חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-coder-1.3b-instruct")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 5.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אך משקלי המודל עצמם כפופים לרישיון ייעודי של היוצרים המסומן כ־other. הכרטיס מציין שהמודל פתוח לשימוש מסחרי, אך יש תנאים נפרדים בקובץ הרישיון המקורי של DeepSeek שחשוב לבדוק לפני הטמעה במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗