GPT
C

CodeLlama-34B-Instruct-GGUF

קוד פתוח

TheBlokellama22023-08-24

  • transformers
  • gguf
  • llama
  • llama-2
  • text-generation

גרסת GGUF של מודל הקוד הגדול של מטא מאפשרת להריץ השלמת קוד ושיחה טכנית מקומית. מי שבוחר בו מחפש ביצועים של 34 מיליארד פרמטרים בלי לשלוח שורות קוד לשרת חיצוני.

  • 238 GBמשקל הקבצים
  • 8,189הורדות בחודש
  • 108לייקים

מה זה

מטא אימנה את הדגם הזה על גבי ארכיטקטורת Llama 2 בין ינואר ליולי 2023, כשהוא ממוקד כולו בייצור והבנה של קוד לצד מענה להנחיות באנגלית. מדובר בדגם הגדול ביותר במשפחה, מעל גרסאות ה־7B וה־13B, והוא עבר כוונון ייעודי למעקב אחר הוראות כדי לשמש כעוזר פיתוח וכדי להקטין יצירת תשובות בעייתיות. הפורמט כאן הוא GGUF, שהחליף את GGML בקיץ 2023 ומאפשר הרצה יעילה עם תמיכה מדויקת יותר בטוקניזציה ובמטא־דאטה.

בניגוד לגרסת הבסיס, דגם ה־Instruct יודע לקבל שאלות בפורמט שיחה מוגדר מראש ולהחזיר פתרונות מנומקים עטופים בבלוקים של קוד. עם זאת, הכרטיס מציין במפורש שהוא לא כולל יכולות infilling, כלומר השלמת קוד באמצע קובץ קיים, ואינו מוגדר כמומחה פייתון ייעודי כמו גרסת הפייתון הנפרדת של הסדרה. הוא נועד לקחת בעיה מתוארת, להבין את המגבלות שלה, ולייצר פתרון תוכנה מלא בהתאם לבקשה שלכם.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    כתיבת פונקציות מלאות מאפס לפי תיאור מילולי מוגדר ומקרי קצה, כולל עטיפת התשובה בתגי קוד מתאימים.

  • עוזר פיתוח מקומי מאובטח

    הרצת צ'אט טכני לניתוח שגיאות והסבר קוד ישירות על החומרה המקומית, בלי לחשוף שום מידע לרשת.

  • סקירת קוד ואיתור באגים

    הזנת קטעי קוד שלמים לתוך תבנית ההוראות כדי לאתר תקלות תחביר ולוגיקה על בסיס הנחיות בדיקה מוגדרות.

איפה זה נופל

הכרטיס מדגיש שהדגם אומן ונבדק באנגלית בלבד, ולכן שימוש בעברית או בשפות אחרות מוגדר מחוץ לטווח השימוש התקין ולא יניב תוצאות עקביות. בנוסף, חסרה בו תמיכה במילוי קוד באמצע קטע קיים, כך שהוא מתאים לייצור קוד מאפס ולא לעבודה כתוסף השלמה שקט בעורך הטקסט. מטא מזהירה מפורשות שהפלט אינו צפוי ויכול להכיל קוד שגוי או לא בטוח, מה שמחייב בדיקות קפדניות לפני שמריצים את מה שהוא כותב.

אותה משפחה

CodeLlama יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית לכתיבת הערות או פרומפטים?

לא. כרטיס המודל מגדיר שימוש בשפות שאינן אנגלית כמחוץ לטווח המיועד. אימון המודל והבדיקות שלו נעשו באנגלית בלבד, ולכן ניסיון לתשאל אותו בעברית יוביל לתוצאות גרועות או לשגיאות בייצור הקוד.

האם אפשר להשתמש בו להשלמת קוד תוך כדי הקלדה ב־IDE?

הדגם הספציפי הזה אינו תומך ב־infilling, כלומר השלמת קוד שיושב בין שורות קיימות. הוא נבנה כמודל Instruct שמקבל הנחיה שלמה ומחזיר בלוק קוד חדש, ולא כרכיב שמשלים שורות בודדות בתוך קובץ פעיל.

כמה זיכרון וידאו צריך כדי להריץ את גרסת ה־Q4_K_M?

משקל הקובץ ברמת דחיסה כזו עומד על כ־20 גיגה־בייט, ולכן תצטרכו כרטיס מסך עם 24GB זיכרון לפחות כדי להחזיק את המודל במלואו על המאיץ הגרפי. אם יש לכם פחות זיכרון, תצטרכו להעביר חלק מהשכבות למעבד המרכזי ולוותר על מהירות הפקה.

איך מריצים

המודל דורש כלי תומך GGUF כמו llama.cpp, תוכנת LM Studio או ספריות פייתון כמו ctransformers ו־llama-cpp-python. דגם של 34 מיליארד פרמטרים כבד מדי להרצה על מעבד בלבד אם אתם מצפים למהירות עבודה שוטפת, כך שתצטרכו כרטיס מסך עם לפחות 24GB של זיכרון וידאו, או פריסה של שכבות בין ה־GPU ל־RAM. קובץ דחוס יחיד בקוונטיזציה של 4 ביט שוקל כ־20 גיגה־בייט ומציע איזון שפוי בין איכות לדרישות חומרה.

אם אין לכם כרטיס גרפי מתאים בתחנת העבודה, זמני התגובה ירדו לרמה שלא תאפשר שימוש רציף כעוזר פיתוח. במצב כזה, עדיף לצרוך מודל דרך שרת ייעודי בענן או API חיצוני במקום לנסות להריץ אותו מקומית על מחשב נייד סטנדרטי.

ollama run hf.co/TheBloke/CodeLlama-34B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון llama2 של מטא, שמאפשר שימוש מסחרי ומחקרי בכפוף לתנאי השימוש ומדיניות השימוש ההוגן שלהם. הרישיון דורש מעקב אחר ההגבלות של מטא, כולל איסור על שימוש לא חוקי או שימוש בשפות שאינן אנגלית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗