GPT
Q

Qwen2.5-Coder-14B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-11-09

  • transformers
  • gguf
  • code
  • codeqwen
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF למודל קוד שיושב בדיוק באמצע, חזק משמעותית ממודלי 7B ומסוגל לרוץ מקומית בלי לקנות שרת ייעודי. פתרון מעשי למי שרוצה השלמות קוד פרטיות.

  • 182 GBמשקל הקבצים
  • 106,828הורדות בחודש
  • 203לייקים

מה זה

מדובר במודל של 14.7 מיליארד פרמטרים שאומן מראש על 5.5 טריליון טוקנים, בדגש על שפות תכנות, פתרון בעיות מתמטיות ויכולות הנמקה. המטרה כאן היא לתת מענה לכתיבה, תיקון והסבר של קוד, כולל עבודה כסוכן אוטונומי שמפעיל כלים.

ההבדל העיקרי מול מודלים קטנים יותר הוא היכולת להחזיק היגיון מורכב בלי להתבלבל כל שתי פסיקות. מודלי 7B נוטים להמציא ספריות כשמבקשים מהם משהו שחורג מ־CRUD בסיסי. הגודל הזה, לעומת זאת, סוגר את הפער מול המודלים הענקיים ברוב המשימות היומיומיות, אבל נשאר בטווח שמאפשר להריץ אותו על כרטיס מסך ביתי חזק או בזיכרון של מחשב נייד.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    רץ ברקע על המחשב ומציע שורות או פונקציות בלי לשלוח קוד קנייני של החברה לשרתים חיצוניים.

  • סקירת קוד וניתוח שגיאות

    מעבירים לו פונקציות שבורות ומקבלים הסבר מנומק איפה הטעות ואיך לתקן אותה בצורה נכונה.

  • סוכן לפיתוח אוטונומי

    משתלב במערכות שמריצות בדיקות, מתקנות שגיאות קומפילציה ומתקדמות לבד לפי ההנחיות שלכם.

איפה זה נופל

הכרטיס מצהיר בפירוש שגרסת ה־GGUF מוגבלת לחלון הקשר של 32,768 טוקנים בלבד. מי שרוצה למתוח את ההקשר עד 128K טוקנים באמצעות YARN לא יכול לעשות את זה כאן, וצריך לעבור למודל המקורי עם מנוע vLLM. בנוסף, המודל מוגדר רשמית לאנגלית בלבד, כך שלא הייתי בונה עליו להערות קוד או תיעוד בעברית בלי לבדוק היטב שהוא לא מייצר ג'יבריש.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להשתמש בכל 128 אלף הטוקנים של ההקשר בגרסה הזו?

לא. גרסת ה־GGUF הזו תומכת רק בעד 32,768 טוקנים. אם יש לכם קובצי ענק או בסיס קוד שלם שאתם חייבים לטעון בבת אחת, תצטרכו להשתמש במודל המקורי עם vLLM.

למה הקבצים מגיעים מפוצלים ואיך פותרים את זה?

הקבצים הגדולים מחולקים לכמה חלקים בגלל מגבלות גודל של השרתים. מורידים את כל החלקים של אותה רמת דחיסה ומאחדים אותם לקובץ אחד באמצעות הפקודה llama-gguf-split שמגיעה עם llama.cpp.

איך מריצים

כדי להריץ אותו מורידים קובץ קוונטיזציה בודד דרך llama.cpp, ולא את כל המאגר ששוקל 182 גיגה. יש פה שמונה רמות דחיסה שונות, החל מ־q2_K המצומק ועד q8_0 הכבד. לרוב השימושים, גרסאות כמו q4_K_M או q5_K_M נותנות את הפשרה הטובה ביותר בין צריכת זיכרון לאיכות הקוד.

חלק מהקבצים הגדולים מפוצלים למספר חלקים בגלל מגבלות אחסון, אז צריך לאחד אותם עם הכלי הפנימי של llama.cpp לפני ההפעלה. אם אין לכם לפחות 16 עד 24 גיגה זיכרון פנוי בכרטיס המסך או בזיכרון המאוחד, הביצועים ירדו משמעותית, ובמצב כזה עדיף לשלם לפי טוקן ל־API מאשר לסבול זמני תגובה איטיים.

ollama run hf.co/Qwen/Qwen2.5-Coder-14B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר פנימי או למכור שירות שנשען עליו. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗