GPT
D

DeepSeek-Coder-V2-Lite-Instruct

קוד פתוח

deepseek-aiother2024-06-14

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

מודל קוד פתוח שמביא ביצועים של מודלים ענקיים בגודל קומפקטי יחסית. הוא מפעיל רק חלק קטן מהפרמטרים בכל פעולה, ומתאים למי שרוצה כלי פיתוח חזק בלי להחזיק חוות שרתים.

  • 16Bפרמטרים
  • 163,840טוקנים בהקשר
  • 29.3 GBמשקל הקבצים
  • 743,890הורדות בחודש

מה זה

זהו מודל מבוסס תצורת תערובת מומחים שכולל כמעט 16 מיליארד פרמטרים, אבל בפועל מפעיל רק 2.4 מיליארד בכל שלב של עיבוד. המבנה הזה נותן לו לרוץ מהר וביעילות של מודל קטן, תוך שמירה על עומק ויכולת הכללה של רשת גדולה בהרבה. הוא אומן על תוספת של שישה טריליון טוקנים כדי לחזק כתיבת קוד וחשיבה מתמטית, ומרחיב את התמיכה ל־338 שפות תכנות.

במבחני ביצועים בתחום התכנות והמתמטיקה הוא מציג תוצאות שמתחרות ישירות במודלים סגורים ומובילים כמו אלה של המתחרים הגדולים. חלון ההקשר שלו מגיע עד 128 אלף טוקנים בבדיקות או 163,840 בהגדרות הקבצים, מה שמאפשר לו לקרוא קבצי מקור ארוכים או פרויקטים שלמים בלי לאבד את הקשר הדיון באמצע.

מתאים ל

  • השלמת קוד מקומית

    הוא מפעיל רק 2.4 מיליארד פרמטרים בפועל, ולכן מייצר השלמות במהירות גבוהה בתוך סביבת הפיתוח.

  • ניתוח בסיסי קוד שלמים

    חלון הקשר של מעל 128 אלף טוקנים מאפשר להזין ספריות שלמות ומסמכי ארכיטקטורה יחד.

  • פתרון בעיות מתמטיות

    האימון הנוסף חיזק יכולות לוגיות מורכבות מעבר ליכולת הכללית של מודלים קטנים רגילים.

איפה זה נופל

ארכיטקטורת המומחים מורכבת ודורשת תמיכה ייעודית בתוכנת ההרצה, כמו טלאים מיוחדים לספריות שרתים פופולריות, ואי אפשר לזרוק אותה על כל סביבת הרצה ישנה ולצפות שתעבוד מיד. בנוסף, מודלים שמתמקדים בקוד נוטים לעיתים קרובות להזיות בתחביר של שפות נידחות מתוך 338 השפות המוצהרות, ולכן יש לבדוק היטב את הפלטים לפני שמשלבים אותם אוטומטית במאגר הקוד שלכם.

אותה משפחה

DeepSeek-Coder-V2-Lite יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

במשקל מלא של מעל 29 גיגהבייט הוא לא ייכנס לכרטיסים ביתיים נפוצים שיש להם 8 עד 16 גיגהבייט זיכרון. תצטרכו להשתמש בגרסה מכווצת ומקומפלת, או להחזיק חומרה שמציעה לפחות 32 גיגהבייט זיכרון גרפי ייעודי.

מה המשמעות של מודל עם 16 מיליארד פרמטרים שמפעיל רק 2.4 מיליארד?

המודל מורכב מכמה רשתות מומחיות פנימיות שונות. בכל טוקן שנכנס, המערכת בוחרת ומפעילה רק את הנתיב המתאים, וכך מקבלים איכות של מודל רחב אבל משלמים בזמן חישוב של מודל קטן בהרבה.

איך מריצים

המשקל הכולל של הקבצים עומד על 29.3 גיגהבייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך מקצועי עם לפחות 32 גיגהבייט זיכרון כדי לטעון אותו ישירות בלי קוונטיזציה. אפשר להריץ אותו דרך ספריית transformers הרגילה עם תמיכה בהרצת קוד חיצוני, אבל החברה ממליצה להשתמש ב־vLLM כדי לנצל את הארכיטקטורה בצורה יעילה.

אם יש לכם מחשב אישי סטנדרטי בלי חומרת שרתים ייעודית, עדיף לפנות ל־API בתשלום לפי שימוש שהם מציעים או להשתמש בגרסת הצ'אט שלהם. הגרסה המלאה של המשפחה דורשת שמונה כרטיסים של 80 גיגהבייט, ולכן גרסת ה־Lite הזו היא הברירה היחידה שסבירה להרצה עצמית בארגון בינוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-Coder-V2-Lite-Instruct")
print(pipe("שלום"))

הרישיון

הקוד ברישיון MIT חופשי, אך משקולות המודל עצמן כפופות להסכם רישוי ייעודי שהוגדר על ידי החברה. המסמכים מציינים במפורש שהשימוש בדגמי הבסיס וההנחיות מאושר לצרכים מסחריים, אך יש לקרוא את תנאי ההסכם המצורף לפני הפצה בתוך מוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗