GPT
D

lmstudio-community/DeepSeek-Coder-V2-Lite-Instruct-GGUF

קוד פתוח

lmstudio-communityother2024-06-17

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF למודל תכנות מבוסס MoE, שמפעיל רק חלק קטן מהמשקלים בכל שלב. הוא נותן חלון הקשר ענקי של 128k בלי לטחון את כרטיס המסך.

  • 72.2 GBמשקל הקבצים
  • 18,971הורדות בחודש
  • 95לייקים

מה זה

מדובר בהמרה של DeepSeek-Coder-V2-Lite-Instruct לפורמט GGUF בעזרת llama.cpp, שמיועדת ספציפית לכתיבת קוד ולמענה על שאלות במדעי המחשב. המודל בנוי בארכיטקטורת תערובת מומחים עם 16 מיליארד פרמטרים בסך הכול, אבל בפועל רק 2.4 מיליארד פרמטרים מופעלים בכל טוקן, מה שמקצר משמעותית את זמני הריצה בהשוואה למודלים מלאים בגודל דומה.

הבסיס שלו אומן על 6 טריליון טוקנים כדי לחזק ביצועים במתמטיקה ובפיתוח תוכנה. ההבדל המרכזי כאן מול מודלים קטנים אחרים הוא השילוב בין גודל פעיל נמוך מאוד לבין חלון הקשר של 128k טוקנים, שמאפשר להזין תיעוד רחב או קבצי קוד ארוכים למעקב הוראות והשלמת קוד.

מתאים ל

  • השלמת קוד מקומית

    מפעיל רק 2.4 מיליארד פרמטרים בזמן אמת, ולכן מחזיר הצעות קוד מהר בלי להעמיס על המחשב.

  • קריאת קבצי קוד ארוכים

    תומך בחלון הקשר של 128k טוקנים, מה שמאפשר לנתח מודולים שלמים ומסמכי פיתוח בבת אחת.

  • פתרון בעיות באלגוריתמים

    אומן על טריליוני טוקנים של מתמטיקה ותוכנה לצורך מענה מדויק על חישובי לוגיקה.

איפה זה נופל

יש פה מלכודת בפרומפט הרשמי. התבנית המקורית נוטה להוציא תשובות בסינית, ולכן צריך להשתמש בהגדרת הפרומפט הייעודית של Deepseek Coder שמגבילה אותו לענות באנגלית וסביב מדעי המחשב בלבד. בנוסף, חובה לנטרל את Flash attention, כך שאי אפשר לנצל את האופטימיזציה הזו לזיכרון בזמן ריצה מקומית.

שאלות
נפוצות

למה המודל מוציא לי תשובות בסינית?

התבנית הרשמית גורמת לו לעיתים לכתוב בסינית. כדי לתקן את זה, בוחרים בתוכנה את הפרומפט המוכן של Deepseek Coder שמוסיף הוראה מפורשת לענות באנגלית על נושאי תכנות.

למה המודל קורס או זורק שגיאה בהרצה?

ברוב המקרים זה קורה כי Flash attention דלוק. חובה לכבות את ההגדרה הזו בהגדרות המודל כדי שהוא יפעל בצורה תקינה.

איך מריצים

כדי להריץ אותו צריך גרסה 0.2.25 ומעלה של LM Studio. דרישה טכנית קריטית היא לכבות לחלוטין את Flash attention בהגדרות, אחרת המודל פשוט לא יעבוד.

בסך הכול יש כאן 9 קבצים במשקל כולל של 72.2 גיגה בייט שמכילים רמות כימות שונות, כך שאפשר לבחור קובץ בודד לפי כמות הזיכרון הפנויה במחשב. אם אין לכם חומרה מקומית שיכולה להחזיק משקלים כאלה בזיכרון, פנייה לשרת מרוחק תחסוך את הורדת הקבצים וההתעסקות בהגדרות.

ollama run hf.co/lmstudio-community/DeepSeek-Coder-V2-Lite-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשמי מוגדר כ־other, כלומר תנאי שימוש מותאמים אישית שלא זהים לרישיונות קוד פתוח סטנדרטיים. לפני שמשלבים אותו במוצר מסחרי או מפיצים אותו הלאה, חובה לבדוק את תנאי הרישיון במאגר המקורי של DeepSeek כדי לראות אם יש הגבלות על שימוש מסחרי.

הרישיון המלא בעמוד המודל ↗