GPT
Q

bartowski/Qwen2.5-Coder-32B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-11-06

  • gguf
  • code
  • codeqwen
  • chat
  • qwen

גרסת GGUF מכווצת למודל קוד של 32 מיליארד פרמטרים. מי שמוריד אותו רוצה יכולות פיתוח חזקות מקומית על החומרה שלו, בלי לשלוח קוד רגיש לשרתים חיצוניים.

  • 467 GBמשקל הקבצים
  • 38,466הורדות בחודש
  • 129לייקים

מה זה

מדובר בהמרה של מודל ההוראות לקוד של עליבאבא לפורמט llama.cpp, שביצע bartowski באמצעות כיול imatrix. המודל מתמחה ביצירת קוד, השלמות והסברים באנגלית לפי תבנית ChatML מובנית. הגודל של 32B נותן מענה חזק בהרבה ממודלי 7B או 14B טיפוסיים, ומתקרב לביצועים של מודלים ענקיים במשימות תכנות, כל עוד מריצים אותו בדיוק סביר.

המאגר מציע שורה ארוכה של רמות כיבוץ, מגרסאות זעירות של 2 ביט ועד Q8 של כמעט 35 גיגה בייט. ברירת המחדל המאוזנת לרוב האנשים היא Q4_K_M במשקל של כמעט 20 גיגה בייט, שמספקת איכות טובה בלי לקרוס תחת דרישות הזיכרון.

מתאים ל

  • השלמת קוד מקומית

    מתאים לחיבור לסביבת הפיתוח כעוזר כתיבה מלא על גבי מחשב חזק ללא תלות ברשת.

  • סקירת קבצי קוד רגישים

    ניתוח ובדיקת אבטחה של קוד ארגוני שלא ניתן להעלות לשירותי צד שלישי בענן.

  • בדיקות אוטומטיות ב־ARM

    הרצה מהירה על שרתי ARM תואמים בעזרת קובצי ה־Q4 הייעודיים לארכיטקטורה זו.

איפה זה נופל

המודל מסומן לעבודה באנגלית בלבד, כך שלא כדאי לבנות עליו להבנת הנחיות מורכבות או הערות קוד בעברית. בנוסף, קבצי הכיבוץ הנמוכים במיוחד, כמו סדרות ה־IQ2 וה־Q2 ששוקלות בין 9 ל־13 גיגה בייט, מוגדרים באיכות נמוכה מאוד ועלולים לייצר שגיאות תחביר או הזיות בקוד. כמו כן, גרסאות ה־I-quants לא עובדות עם מאיצי Vulkan ואיטיות יותר על מעבדי אפל.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון מחשב צריך בשביל להריץ אותו בלי תקיעות?

עבור גרסת ברירת המחדל Q4_K_M נדרשים כ־20 גיגה בייט פנויים בזיכרון כרטיס המסך כדי לקבל מהירות עבודה סבירה. אפשר לערבב זיכרון RAM ו־VRAM, אבל אז המודל יעבוד לאט בהרבה.

איזה קובץ כדאי להוריד מתוך הרשימה?

הקובץ המאוזן ביותר הוא Qwen2.5-Coder-32B-Instruct-Q4_K_M.gguf. אם יש לכם פחות זיכרון אפשר לרדת לכיוון IQ4_XS או Q3_K_XL, אך מתחת לזה איכות יצירת הקוד נפגעת באופן מורגש.

האם המודל יתפקד טוב עם עברית?

הכרטיס מציין אנגלית בלבד כשפת המודל. הוא יתקשה מאוד להבין הנחיות בעברית ולא מיועד למשימות בשפה הזו.

איך מריצים

כדי להריץ אותו מקומית צריך מנוע כמו LM Studio או llama.cpp ישירות. אם רוצים מהירות עבודה נורמלית, כל המודל חייב להיכנס לתוך הזיכרון של כרטיס המסך, כלומר צריך כרטיס עם לפחות 24 גיגה בייט של VRAM בשביל גרסאות Q4. אפשר לפצל את המשקל בין כרטיס המסך לזיכרון המערכת הרגיל, אבל אז מהירות יצירת הטוקנים צונחת משמעותית.

למי שיש חומרה חלשה יותר, גרסאות של פחות מ־4 ביט כמו IQ3 או Q3_K ידרשו פחות זיכרון אך במחיר של ירידה באיכות הקוד. גרסאות Q4_0 המותאמות במיוחד למעבדי ARM מיועדות לשם בלבד, ולא יעבדו כמצופה על חלונות או מק.

ollama run hf.co/bartowski/Qwen2.5-Coder-32B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה חופשית של הקבצים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את קוד המקור של המוצר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗