GPT
P

Phind-CodeLlama-34B-v2-GGUF

קוד פתוח

TheBlokellama22023-08-29

  • transformers
  • gguf
  • llama
  • code llama
  • model-index

גרסת GGUF למודל קוד של Phind שמיועדת להרצה מקומית. הוא פונה למי שרוצה ביצועי פיתוח גבוהים בלי לשלוח קוד פנימי לשרתים חיצוניים.

  • 238 GBמשקל הקבצים
  • 3,895הורדות בחודש
  • 171לייקים

מה זה

המודל מבוסס על CodeLlama 34B ועבר אימון מלא, ללא שימוש ב־LoRA, על 1.5 מיליארד טוקנים נוספים של בעיות תכנות ופתרונות. הוא מכוון לעבודה מול הוראות ישירות ומבין שפות פיתוח פופולריות כמו פייתון, C++, טייפסקריפט וג'אווה. המבנה שלו מותאם למענה על שאלות הנדסיות וכתיבת פונקציות מאפס.

במדד HumanEval המודל הגיע לתוצאה של 73.8 אחוזים בבדיקת pass@1. בפועל זה אומר שעל מאגר מבחני התכנות הסטנדרטי הזה, כמעט שלושה מכל ארבעה פתרונות ראשונים שהמודל פלט עברו את כל בדיקות היחידה ללא צורך בתיקון נוסף. עבור מודל פתוח מדובר ברמת דיוק שמספיקה לכתיבת שלד לקוד ומציאת באגים נקודתיים.

מתאים ל

  • עוזר פיתוח מקומי ומאובטח

    מאפשר כתיבת קוד ובדיקת אלגוריתמים ישירות על המחשב בלי להוציא קוד קנייני לרשת.

  • פתרון באגים בפייתון ו־C++

    מתאים לאיתור שגיאות תחביר ולוגיקה בפונקציות בודדות בזכות אימון ממוקד בפתרון בעיות.

  • כתיבת בדיקות יחידה

    מייצר בדיקות לקטעי קוד נתונים ביעילות גבוהה שנשענת על נתוני מעבר המבחנים שלו.

איפה זה נופל

יוצרי המודל מצהירים מראש שהוא עבר בדיקות בטיחות מוגבלות מאוד, ולכן אסור להסתמך עליו בסביבות רגישות בלי בדיקה אנושית של הקוד. אורך ההקשר שהוגדר באימון עומד על 4096 טוקנים בלבד, מגבלה שתקשה עליו לנתח קבצים ארוכים או פרויקטים שלמים בפעימה אחת.

אותה משפחה

Phind-CodeLlama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון דרוש כדי להריץ את המודל בצורה שמישה?

עבור גרסת Q4_K_M המומלצת דרושים לפחות 23 גיגה-בייט של זיכרון פנוי. אם רוצים מהירות עבודה טובה, כדאי להשתמש בכרטיס מסך עם 24 גיגה-בייט זיכרון גרפי כדי לפרוק אליו את רוב השכבות.

האם המודל מתאים לניתוח מאגרי קוד שלמים?

לא. חלון ההקשר עומד על 4096 טוקנים, ולכן הוא מתאים בעיקר לפונקציות בודדות, מחלקות קצרות או משימות נקודתיות ולא לסריקת פרויקטים גדולים.

איך מריצים

קובץ ה־GGUF מאפשר להריץ את המודל דרך llama.cpp, ממשקי רשת כמו text-generation-webui, או ספריות פייתון כמו ctransformers. לצורך ההרצה נדרש זיכרון עבודה משמעותי. הגרסאות הקטנות ביותר, ברמת כימות של 2 או 3 ביטים, שוקלות בין 14 ל־17 גיגה-בייט ודורשות סביב 17 עד 20 גיגה-בייט של זיכרון, אך מחיר הדיוק בהן גבוה. הגרסה המאוזנת והמומלצת, Q4_K_M, דורשת 22.72 גיגה-בייט של זיכרון ומספקת פלט יציב בהרבה.

אם יש לכם כרטיס מסך מודרני עם 24 גיגה-בייט VRAM, תוכלו לטעון אליו את רוב שכבות המודל בכימות של 4 ביט ולקבל מהירות הפקה סבירה. ללא כרטיס כזה המודל ירוץ על המעבד והזיכרון הראשי, מה שיוביל לקצב איטי מאוד של טוקנים לשנייה. במצב כזה עדיף לשלם לפי קריאה למודל מרוחק ולא להשקיע בחומרה מקומית ייעודית.

ollama run hf.co/TheBloke/Phind-CodeLlama-34B-v2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא llama2. הוא מתיר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של חברת מטא, כולל חובת תאימות למדיניות השימוש שלה ותנאים מיוחדים לחברות בעלות היקף משתמשים חודשי עצום.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗