GPT
C

CodeLlama-13B-GGUF

קוד פתוח

TheBlokellama22023-08-24

  • transformers
  • gguf
  • llama
  • llama-2
  • text-generation

גרסת GGUF של מודל הבסיס לכתיבת קוד מבית מטא. מתאימה למי שרוצה להריץ השלמות קוד מקומיות על המחשב בלי לשלוח שורות קוד לשרתים חיצוניים.

  • 91.9 GBמשקל הקבצים
  • 1,727הורדות בחודש
  • 60לייקים

מה זה

מדובר במודל שפת בסיס של 13 מיליארד פרמטרים שאומן בין ינואר ליולי 2023 על קוד וטקסט באנגלית, ומיועד להבנה ויצירה של תוכנה. המאגר מציע קובצי GGUF מכווצים שמאפשרים הרצה מקומית יעילה על גבי ספריות מבוססות llama.cpp, מה שהופך את המודל לנגיש גם בלי תחנת עבודה ייעודית.

הגרסה הזו היא מודל הבסיס ולא גרסת השיחה או גרסת הפייתון הייעודית. הוא מתמקד בשתי משימות עיקריות, השלמת קוד ברצף ומילוי קוד באמצע קטע נתון. אין כאן מנגנון מובנה למענה לשאלות טבעיות, אלא מנוע שממשיך טקסט וקוד באופן ישיר לפי הקלט שהוא מקבל.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    מאפשר השלמה אוטומטית של פונקציות ישירות מעורך הקוד, בלי להוציא קניין רוחני של הפרויקט אל מחוץ לרשת המקומית.

  • מילוי קטעי קוד חסרים

    תומך ביכולת השלמה פנימית של מקטעים מתוך קריאת הקוד שנמצא לפני ואחרי הסמן.

  • אימון מקומי מותאם

    משמש כבסיס יציב של 13 מיליארד פרמטרים לכוונון עדין על בסיס קוד ארגוני סגור.

איפה זה נופל

זהו מודל בסיס נטול כוונון להוראות, ולכן הוא לא מתאים לצ'אט או לתשובות לשאלות בשפה חופשית. כרטיס המודל מציין במפורש שהוא מיועד לאנגלית בלבד, כך ששימוש בעברית ייכשל או ייצר תוצאות גרועות במיוחד. בנוסף, המודל אומן על נתונים סטטיים שהוקפאו ביולי 2023, והוא עלול לייצר קוד שגוי או לא בטוח שמחייב בדיקה ידנית לפני שילובו במערכות אמיתיות.

אותה משפחה

CodeLlama יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזה קובץ כדאי להוריד מהמאגר?

הקובץ המומלץ לרוב השימושים הוא codellama-13b.q4_K_M.gguf. הוא שוקל 7.87 ג'יגה בייט ומספק איזון מעולה בין איכות הקוד לבין צריכת הזיכרון, בלי האובדן המשמעותי שקיים בגרסאות 2 ו־3 ביט.

האם אפשר להשתמש בו כמו ב־ChatGPT כדי לשאול שאלות על קוד?

לא באופן ישיר. זהו מודל בסיס שמשלים טקסט ולא מודל שיחה, ולכן הוא אינו כולל תבנית שיחה מובנית. כדי לשוחח ולקבל תשובות להוראות עדיף להוריד את גרסת ה־Instruct של המודל.

איך מריצים

גודל הקבצים נע בין 5.43 ג'יגה בייט בגרסת Q2_K הזעירה ועד 13.83 ג'יגה בייט בגרסת Q8_0. הגרסאות המאוזנות והמומלצות ביותר, כמו Q4_K_M ו־Q5_K_M, שוקלות סביב 7.8 עד 9.2 ג'יגה בייט ודורשות בין 10.4 ל־11.7 ג'יגה בייט זיכרון עבודה בהרצה על מעבד בלבד. אם מעבירים שכבות לעיבוד בכרטיס מסך, הדרישה הזו עוברת לזיכרון הווידאו ומאיצה משמעותית את קצב יצירת הטוקנים.

אפשר להריץ אותו מקומית דרך llama.cpp, ממשקי משתמש כמו LM Studio או text-generation-webui, ובקוד פייתון בעזרת ספריות כמו ctransformers או llama-cpp-python. אם אין לכם לפחות 12 ג'יגה בייט זיכרון פנוי במחשב, או שאתם צריכים זמני תגובה מיידיים של שבריר שנייה בלי להעמיס על המעבד, עדיף להשתמש במודל ענן דרך שירות חיצוני.

ollama run hf.co/TheBloke/CodeLlama-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון מותאם של מטא עבור משפחת Llama 2. הוא מתיר שימוש מסחרי ומחקרי, אך כפוף למדיניות השימוש המקובל של מטא ומגביל את השימוש לשפה האנגלית ולמטרות חוקיות בלבד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗