GPT
D

DeepSeek-Coder-V2-Lite-Instruct-GGUF

קוד פתוח

bartowskiother2024-06-17

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת של מודל קוד פתוח ממוקד תכנות, שמתאימה להרצה מקומית על מחשב אישי. היא חוסכת זיכרון ומאפשרת לעבוד בלי תלות בשרתים חיצוניים.

  • 252 GBמשקל הקבצים
  • 383,443הורדות בחודש
  • 187לייקים

מה זה

הריפוזיטורי הזה מכיל המרות שונות בפורמט GGUF למודל הקוד DeepSeek-Coder-V2-Lite-Instruct, שבוצעו באמצעות llama.cpp עם imatrix. מדובר במודל שמיועד להפקת קוד ולהבנת פקודות בשפות תכנות, כשהמטרה של הקבצים כאן היא לתת מענה למי שרוצה להריץ את העסק מקומית דרך מעבד גרפי או זיכרון המחשב הרגיל.

במקום לקחת את המשקלים הגולמיים הכבדים, bartowski מציע כאן מעל עשרים קבצי כיול וכימות שונים, החל מגרסאות דחוסות מאוד של שני ביטים ועד לגרסאות איכות גבוהה של שמונה ביטים. המשמעות היא שאתם בוחרים קובץ בודד לפי כמות הזיכרון שיש לכם בפועל, במקום להוריד את כל נפח הענק של הריפוזיטורי.

מתאים ל

  • השלמת קוד מקומית

    קובץ Q4_K_M מתאים להרצה על כרטיס מסך בודד לעבודה מקומית ללא שליחת קוד החוצה.

  • הרצה על חומרה חלשה

    גרסאות ה־IQ2 וה־IQ3 יורדות מתחת לשמונה גיגה ומאפשרות בדיקות מהירות על מחשבים פשוטים.

  • בדיקות איכות מקסימליות

    גרסאות Q8 מספקות שחזור כמעט מלא של משקלי המקור למי שמחזיק מעל שבעה עשר גיגה זיכרון פנוי.

איפה זה נופל

הגרסאות הדחוסות מאוד מתחת לערכי ארבעה ביטים, ובמיוחד קבצי ה־Q2 וה־Q3 הנמוכים, מאבדות דיוק תחבירי ועלולות לייצר שגיאות קוד מעצבנות. בנוסף, קבצי ה־I-quants החדשים אינם תואמים ל־Vulkan, ועל מעבדים רגילים או בסביבת Apple Metal הם רצים לאט יותר בהשוואה לגרסאות ה־K הרגילות. חשוב גם לזכור שהמודל מחייב שימוש בתבנית הפרומפט הספציפית שהוגדרה בכרטיס, אחרת איכות התשובות נפגעת מיד.

שאלות
נפוצות

האם צריך להוריד את כל 252 הגיגה של הריפוזיטורי?

ממש לא, מורידים רק קובץ אחד לפי כמות הזיכרון שיש לכם במחשב או בכרטיס המסך. כל קובץ מייצג רמת דחיסה שונה.

מה עדיף, גרסת K או גרסת I?

אם אתם מכוונים לדחיסה של פחות מארבעה ביטים ומריצים על כרטיס של Nvidia או AMD בחיבור תואם, גרסאות ה־I נותנות איכות טובה יותר לגודל שלהן. בשאר המקרים, גרסאות ה־K הן הבחירה הבטוחה והפשוטה.

איך מריצים

אתם צריכים לבחור קובץ אחד בלבד. הגדלים נעים בין 5.96 גיגה בייט בגרסת IQ2_XS ועד 17.09 גיגה בייט בגרסת Q8_0_L, כשהאיזון המומלץ לרוב כרטיסי המסך הביתיים נמצא סביב Q4_K_M שלוקח 10.36 גיגה בייט.

כדי שההרצה תהיה מהירה, המודל חייב להיכנס במלואו לתוך הזיכרון של כרטיס המסך, עם מרווח ביטחון של גיגה או שניים. אם יש לכם כרטיס עם 12 או 16 גיגה זיכרון, הגרסאות הבינוניות יעבדו חלק, אבל אם אתם נאלצים לזלוג לזיכרון הראשי של המחשב, קצב יצירת הטקסט יצנח משמעותית.

ollama run hf.co/bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשום בכרטיס הוא other בלבד, ללא פירוט של תנאי השימוש המקוריים או היתר מפורש לשימוש מסחרי. לפני שמשלבים את הקבצים האלה במוצר עסקי, חובה לבדוק את הרישיון המקורי בעמוד הרשמי של deepseek-ai כדי להבין אילו הגבלות חלות על הפצה ושימוש בתוצרים.

הרישיון המלא בעמוד המודל ↗