GPT
C

CodeLlama-13B-Instruct-GGUF

קוד פתוח

TheBlokellama22023-08-24

  • transformers
  • gguf
  • llama
  • llama-2
  • text-generation

גרסה מכווצת של מודל הקוד מבית מטא שמתאימה להרצה ישירה על מעבדים וכרטיסים ביתיים. היא מספקת השלמת פקודות ושיחה סביב פיתוח בלי לשלוח קוד פנימי לשרתים חיצוניים.

  • 91.9 GBמשקל הקבצים
  • 7,653הורדות בחודש
  • 132לייקים

מה זה

מטא אימנה את הסדרה הזו על בסיס Llama 2 עם דגש על תחום התוכנה, וכאן מדובר בגרסת הביניים שעברה התאמה להוראות מפורשות. TheBloke המיר את המשקלים לפורמט GGUF, מה שמספק טעינה פשוטה בספריות מקומיות וחסכון בזיכרון עבודה ביחס למקור.

בניגוד לגרסת הבסיס שנועדה להשלמת טקסט עיוורת או לגרסת הפייתון הייעודית, גרסת ה־Instruct מכוונת לשיחה טכנית, תיקון באגים ומענה לפקודות מוגדרות. היא יודעת לקבל בעיה, לנתח אילוצים ולהחזיר בלוקי קוד בתוך תבנית שיחה. עם זאת, אין כאן התמחות בלעדית בשפה אחת אלא תמיכה כללית בכתיבה והבנה של קוד לצד הסברים באנגלית.

מתאים ל

  • עוזר פיתוח מקומי ב־IDE

    מאפשר לשאול שאלות על קוד ולקבל הצעות למימוש בלי להוציא מידע רגיש מהרשת הפנימית.

  • יצירת בדיקות תוכנה

    מקבל פונקציות ומחזיר מקרי קצה ומבחני יחידה לפי תבנית הבקשה שהוגדרה מראש.

  • הסבר ותיעוד פונקציות

    מפרק קטעי קוד קיימים להסבר מילולי מובנה ומחלץ מתוכם הערות תיעוד באנגלית.

איפה זה נופל

הכרטיס מדגיש שהבדיקות נעשו באנגלית בלבד. כל שימוש בעברית, בהוראות או בהערות קוד, לא נתמך רשמית ועלול לייצר פלט משובש. בנוסף, מטא מזהירה שהפלט אינו צפוי ויכול להכיל קוד שגוי או לא בטוח, כך שחובה להריץ בדיקות קפדניות לפני שילוב התוצרים במערכות אמיתיות.

אותה משפחה

CodeLlama יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

באיזו תבנית פרומפט צריך להשתמש כדי לקבל תוצאות טובות?

המודל אומן ספציפית על תבנית שמתחילה בתגית INST וכוללת הוראה לעטוף את התשובה בסימני קוד. שימוש בטקסט חופשי בלי התבנית הרשמית יפגע באיכות המענה ויקשה על קבלת פלט עקבי.

אפשר להריץ את המודל על מעבד רגיל בלי כרטיס מסך?

כן, פורמט GGUF נבנה בדיוק בשביל זה דרך llama.cpp. עם זאת, קצב יצירת הטוקנים במעבד בלבד יהיה איטי משמעותית ביחס לחומרה עם מעבד גרפי שמחזיק את כל השכבות בזיכרון ה־VRAM.

איך מריצים

טוענים קובץ בודד דרך llama.cpp, LM Studio, או בסקריפט פייתון עם ספריית ctransformers ו־llama-cpp-python. דף המאגר מציע קבצים ברמות כימות שונות, בין 2 ל־8 ביט. לשימוש שוטף, קובץ כמו Q4_K_M דורש בערך עשרה עד שנים עשר גיגה־בייט של זיכרון עבודה, ומאפשר להעביר חלק מהשכבות או את כולן לכרטיס מסך כדי להאיץ את התגובה.

אם אין לכם מחשב עם 16GB זיכרון או מעבד גרפי סביר, הביצועים בלחיצה על מקלדת יהיו איטיים. במקרים של עומס גדול בייצור או חומרה חלשה, קריאה למודל מרוחק דרך ספק ענן תעבוד מהר יותר ותחסוך תחזוקה.

ollama run hf.co/TheBloke/CodeLlama-13B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama2 המקורי של מטא. הוא מאפשר שימוש מסחרי ומחקרי, אך כפוף למדיניות השימוש ההוגן ולמגבלות הרישוי המקוריות של החברה, כולל מגבלות על היקף משתמשים חודשי חריג ותאימות לכללי בטיחות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗