GPT
C

CodeLlama-7B-GGUF

קוד פתוח

TheBlokellama22023-08-24

  • transformers
  • gguf
  • llama
  • llama-2
  • text-generation

גרסת GGUF מכווצת של מודל הקוד מבית מטא. מתאימה למי שרוצה להריץ השלמת קוד מקומית ישירות על המעבד או כרטיס מסך בסיסי, בלי להוציא הון על שרתים.

  • 47.7 GBמשקל הקבצים
  • 3,372הורדות בחודש
  • 134לייקים

מה זה

מטא אימנה את סדרת Code Llama על בסיס Llama 2 עם דגש על יצירת קוד והבנתו, וכאן TheBloke ארז את גרסת הבסיס של 7 מיליארד פרמטרים בפורמט GGUF. המשמעות היא שניתן להריץ מודל שלם לקוד על חומרה רגילה יחסית דרך llama.cpp או ספריות פייתון תואמות, בלי צורך בסביבת GPU כבדה של שרתי ענן.

בניגוד לגרסת ה־Instruct שמכוונת לשיחה והוראות, זהו מודל הבסיס (Base). הוא יועד בעיקר לשתי משימות מוגדרות: השלמת קוד רציפה (Code completion) ומילוי קטעים חסרים באמצע הקוד (Infilling). הוא לא מגיע מותאם לשיחה חופשית ולא מחזיר תשובות מנומסות, אלא פשוט מנחש את השורות הבאות של התוכנית שאתם כותבים.

מתאים ל

  • השלמת קוד בעורך

    חיבור ישיר לסביבת הפיתוח כמנוע השלמה אוטומטי מקומי ומהיר לחלוטין.

  • מילוי קטעי קוד חסרים

    ביצוע Infilling ליצירת קוד פנימי בתוך פונקציה קיימת בלי לשבור תחביר.

  • פיתוח אופליין מאובטח

    עבודה על קוד פנימי שלא יכול לצאת לרשת או לעבור דרך API חיצוני.

איפה זה נופל

זה לא מודל לצ'אט ולא עוזר אישי. הכרטיס מציין במפורש שאין לו יכולות שיחה או מעקב אחר הוראות (Instructions/chat), וגם אין לו תבנית פרומפט מובנית. אם תבקשו ממנו להסביר באג בעברית או לתכנן ארכיטקטורה, תקבלו המשך טקסט מקרי במקום תשובה הגיונית. בנוסף, הוא נבדק ואומן באנגלית בלבד, כך שלא הייתי בונה עליו לקוד עם הערות בעברית או לוגיקה תלויית שפה מקומית.

אותה משפחה

CodeLlama יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להשתמש במודל הזה בתור צ'אט בוט לתכנות?

לא. מדובר במודל הבסיס ולא בגרסת ה־Instruct. אם אתם מחפשים לשאול שאלות ולקבל תשובות מוסברות, תצטרכו להוריד את גרסת ה־Instruct של CodeLlama ולא את הקבצים במאגר הזה.

איזה קובץ הכי מומלץ להוריד מתוך הרשימה?

קובץ codellama-7b.Q4_K_M.gguf הוא נקודת ההתחלה המאוזנת ביותר. הוא שוקל כ־4.08 גיגה־בייט, דורש מעט מעל 6.5 גיגה־בייט זיכרון, ושומר על איכות פלט טובה בלי להעמיס על המחשב.

האם המודל תומך בעבודה בעברית?

האימון והבדיקות של המודל נעשו באנגלית בלבד ובשפות תכנות. עדיף לא להסתמך עליו בטקסטים בעברית, כולל מחרוזות והערות בתוך הקוד.

איך מריצים

אין שום סיבה להוריד את כל 47.7 הגיגה־בייט שנמצאים במאגר. מורידים רק קובץ בודד בהתאם לחומרה שלכם. קובץ ה־Q4_K_M שוקל 4.08 גיגה־בייט ודורש סביב 6.58 גיגה־בייט זיכרון עבודה בריצה על המעבד בלבד, כך שהוא מתאים לכל מחשב פיתוח מודרני עם 8 או 16 גיגה זיכרון. אם יש לכם כרטיס מסך מתאים, אפשר לפרוק אליו שכבות כדי להאיץ את קצב יצירת הטוקנים.

הגרסאות נעות בין Q2_K הזעירה שסובלת מאיבוד איכות מורגש, לבין גרסאות כמו Q5_K_M או Q6_K שדורשות 7 עד 8 גיגה זיכרון אבל שומרות על דיוק גבוה. אם אתם זקוקים להשלמות קוד מורכבות מאוד בעשרות קבצים בו־זמנית, שרת מרוחק או שירות ענן ייתנו ביצועים טובים בהרבה מהרצה מקומית של מודל בגודל 7B.

ollama run hf.co/TheBloke/CodeLlama-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama2 המקורי של מטא. מותר להשתמש בו לצרכים מחקריים ומסחריים, בכפוף לתנאי השימוש ומדיניות השימוש ההוגן של מטא, כל עוד המוצר שלכם לא פונה למאות מיליוני משתמשים פעילים ולא מפר את חוקי הייצוא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗