GPT
Q

bartowski/Qwen2.5-Coder-14B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-11-06

  • gguf
  • code
  • codeqwen
  • chat
  • qwen

גרסת GGUF מכווצת של מודל קוד בגודל 14B, שמיועדת להרצה מקומית ב־llama.cpp או LM Studio. בחירה פרקטית למי שרוצה ביצועי קוד חזקים בלי לשלוח נתונים החוצה.

  • 234 GBמשקל הקבצים
  • 31,462הורדות בחודש
  • 56לייקים

מה זה

הפרויקט הזה מנגיש את מודל הקוד של עליבאבא בגרסאות מכווצות שונות דרך llama.cpp, כולל שימוש בכיול imatrix כדי לצמצם פגיעה באיכות. המודל מתמקד ביצירת קוד, מענה להוראות טכניות ופתרון בעיות תכנות, כשהוא מביא נקודת איזון מעניינת בין מודלי 7B או 8B קלים לבין מפלצות של 32B ומעלה.

במקום לקחת את המודל המקורי במשקל מלא של 29.55GB ב־f16, יש כאן חלוקה רחבה של קבצים מ־4.70GB ועד 15.70GB. זה מתאים למי שרוצה כלי עבודה אמיתי לקוד על המחשב שלו, בלי להסתמך על חיבור רשת או ספקים חיצוניים שרואים כל שורת קוד בפרויקט.

מתאים ל

  • עוזר קוד אישי באופליין

    גרסת Q4_K_M נכנסת לכרטיס מסך ממוצע ומספקת השלמות קוד פרטיות לחלוטין בלי גישה לאינטרנט.

  • סקירת קוד ואיתור באגים

    משקל של 14B מספיק גדול כדי להבין לוגיקה מורכבת ולמצוא בעיות בפונקציות שלמות באנגלית.

  • הרצה על שרתי ARM ייעודיים

    קבצי Q4_0_X_X כוללים אופטימיזציה ישירה לחומרת ARM ומספקים מהירות ריצה גבוהה במיוחד שם.

איפה זה נופל

המודל מוגדר רשמית לשפה האנגלית בלבד. אם תזרקו עליו הערות בקוד בעברית או תבקשו תיעוד בעברית, התוצאות יהיו שבורות או לא עקביות. בנוסף, גרסאות הכיווץ הנמוכות ביותר כמו IQ2 או Q2 מוגדרות במפורש באיכות נמוכה מאוד, כך שרמת ההזיות בקוד ובפרטים סינטקטיים עולה בהן בצורה מורגשת.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מתוך כל הרשימה?

לרוב המשתמשים מומלץ לקחת את Q4_K_M ששוקל 8.99GB, כי הוא נותן את האיזון הטוב ביותר בין איכות ומשקל. אם יש לכם מספיק מקום בכרטיס המסך, קחו את Q5_K_M או Q6_K לאיכות מקסימלית.

האם המודל יפעל טוב על מחשב נייד רגיל בלי כרטיס מסך?

הוא יפעל דרך המעבד הראשי ו־RAM רגיל אם תורידו גרסה קטנה, אבל קצב יצירת הטוקנים יהיה איטי מאוד. לעבודה שוטפת כעוזר פיתוח, כרטיס מסך ייעודי הוא כמעט חובה.

האם אפשר להשתמש בקובצי Q4_0_4_4 על מק?

לא. הקבצים האלה מקודדים ספציפית לשרתי ומעבדי ARM ייעודיים עם הרחבות מסוימות, ויוצר המאגר מציין במפורש לא להשתמש בהם על Mac או Windows.

איך מריצים

כדי להריץ אותו, מורידים קובץ בודד שמתאים לזיכרון שלכם, ולא את כל המאגר. אם אתם רוצים ביצועים מהירים, הקובץ כולו חייב להיכנס ל־VRAM של כרטיס המסך, עם מרווח ביטחון של גיגהבייט או שניים. לדוגמה, גרסת Q4_K_M שוקלת 8.99GB ומוגדרת כברירת מחדל מומלצת, כך שהיא יושבת בנוחות על כרטיס עם 12GB או 16GB זיכרון. למי שיש כרטיסים חלשים יותר, יש גרסאות I-quant שיורדות עד 4.70GB, אך הן איטיות יותר על מעבדים מסוימים ולא נתמכות ב־Vulkan.

אם אין לכם כרטיס מסך מתאים ואתם מתכננים להריץ אותו רק על זיכרון המחשב הרגיל, המהירות תצנח משמעותית. במצב כזה, או אם אתם צריכים לשרת עשרות מפתחים בו-זמנית, הרצה מקומית תהיה איטית מדי ועדיף לשלם לפי טוקן לספק ענן.

ollama run hf.co/bartowski/Qwen2.5-Coder-14B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗