GPT
C

Codestral-22B-v0.1-GGUF

קוד פתוח

bartowskiother2024-05-29

  • gguf
  • code
  • text-generation
  • imatrix

גרסה מכווצת של מודל קוד ייעודי עם 22 מיליארד פרמטרים שמתאימה להרצה על כרטיסי מסך ביתיים. מפתח שרוצה השלמות קוד מקומיות בלי לשלוח שום דבר לשרתים חיצוניים ימצא כאן מענה מדויק.

  • 270 GBמשקל הקבצים
  • 9,157הורדות בחודש
  • 200לייקים

מה זה

מדובר במודל שמיועד ליצירת קוד, שמבוסס על המודל המקורי של חברת Mistral ומוגש כאן באוסף כימותים של llama.cpp בגרסה b3024. הוא מתמקד בעבודה עם שפות תכנות ונועד לייצר, לנתח ולהשלים בלוקים של קוד ישירות בסביבת הפיתוח, במקום להישען על מודלי שיחה רחבים שלא אופטימיזציה מלאה לתחביר נוקשה.

ההבדל העיקרי כאן הוא הדחיסה החכמה. bartowski השתמש בשיטת imatrix כדי לחתוך במשקל בלי לרסק את יכולת החשיבה הלוגית של המודל. זה משאיר מודל של 22 מיליארד פרמטרים במצב שבו הוא עדיין מבין תבניות תחביריות מורכבות, אבל לא דורש שרת ענן עם משאבים מנופחים כדי להחזיר תשובה בזמן סביר.

המבנה של המודל דורש פורמט פנייה קפדני מאוד של תגיות INST וסמני מערכת. אם לא שומרים עליהם בדיוק לפי התבנית שהוגדרה, המודל מתחיל לפלוט טקסט מקולקל, מה שמחייב הגדרה נכונה בכלי ההרצה לפני שמתחילים לעבוד מולו בסביבת הפיתוח.

מתאים ל

  • השלמת קוד מקומית

    חיבור ישיר לעורך הקוד שלכם לקבלת הצעות תחביר בלי לחשוף סודות מסחריים.

  • סקירת שגיאות פנימית

    בדיקת פונקציות ואיתור בעיות תחביר לפני דחיפה למאגר, לחלוטין אופליין.

  • תרגום קוד בסביבה מבודדת

    מעבר בין שפות פיתוח בתוך רשת סגורה שלא מאפשרת תקשורת יוצאת לרשת.

איפה זה נופל

המודל מיועד לקוד בלבד, כך שאין טעם לנסות להשתמש בו לשיחות כלליות או לניתוח טקסט עיוני. הכימותים הנמוכים ביותר, כמו משפחת Q2 ששוקלת בין 6 ל־8 ג'יגה בייט, סובלים מאיבוד איכות ברור ועלולים להכניס באגים עדינים או שגיאות תחביר לקוד. בנוסף, קבצי ה־IQ החדשים אינם עובדים עם מנוע ההרצה של Vulkan, כך שמשתמשי כרטיסים מסוימים ייתקלו בשגיאות אם לא יבחרו בגרסאות K הרגילות.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מהעמוד?

הבחירה תלויה בזיכרון של כרטיס המסך שלכם. הקובץ המאוזן והמומלץ לרוב המפתחים הוא Q4_K_M ששוקל 13.34 ג'יגה בייט ונותן איכות מצוינת ביחס לגודל. אם יש לכם כרטיס חזק עם 24 ג'יגה זיכרון, קחו את Q5_K_M או Q6_K לקבלת דיוק מרבי.

מה ההבדל בין גרסאות ה־K לגרסאות ה־IQ?

קבצי IQ משתמשים בשיטות דחיסה מתקדמות יותר שמצליחות לשמור על היגיון הקוד במשקל קטן מאוד, מתחת ל־10 ג'יגה בייט. החיסרון שלהם הוא חוסר תמיכה בסביבות מסוימות כמו Vulkan ומהירות ריצה נמוכה יותר על מעבדים ללא כרטיס מסך תואם.

איך מריצים

מורידים קובץ בודד מתוך הרשימה בעזרת ממשק הטרמינל של huggingface ולא מנסים למשוך את כל התיקייה ששוקלת 270 ג'יגה בייט. לכרטיס מסך עם 16 ג'יגה זיכרון גרפי, גרסאות כמו Q4_K_M ששוקלת 13.34 ג'יגה בייט ייכנסו בשלמותן ויספקו מהירות עבודה גבוהה. אם יש לכם רק 8 ג'יגה זיכרון, תצטרכו לרדת לקבצי IQ2 ששוקלים סביב 7 ג'יגה בייט, או לתת לחלק מהמשקל לזלוג לזיכרון המערכת הרגיל.

מי שאין לו כרטיס מסך מתאים של Nvidia או תמיכה ב־ROCm של AMD ירגיש זחילה משמעותית במהירות התגובה. במקרה שבו אתם עובדים על מחשב נייד חלש בלי מאיץ גרפי ייעודי, עדיף לפנות ל־API בענן ולא לנסות להריץ 22 מיליארד פרמטרים מקומית על המעבד בלבד.

ollama run hf.co/bartowski/Codestral-22B-v0.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other, מה שאומר שהוא אינו משתמש ברישיון קוד פתוח סטנדרטי. המודל המקורי מבית Mistral הופץ תחת תנאים מגבילים שמחייבים בדיקה ישירה של נוסח הרישיון המקורי, במיוחד אם מתכננים לשלב את הפלט שלו בתוך מוצר מסחרי או להציע אותו כשירות בתשלום.

הרישיון המלא בעמוד המודל ↗