GPT
Q

Qwen2.5-Coder-32B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-11-09

  • transformers
  • gguf
  • code
  • codeqwen
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת קוד ממוקדת עם 32.5 מיליארד פרמטרים בפורמט מכווץ, שמיועדת לתת ביצועי תכנות של מודלים ענקיים מקומי על חומרה חזקה.

  • 386 GBמשקל הקבצים
  • 88,008הורדות בחודש
  • 222לייקים

מה זה

המודל הזה אומן על 5.5 טריליון טוקנים שכוללים קוד מקור, נתונים סינתטיים וטקסט טכני. המפתחים שלו טוענים שביצועי התכנות, הסקת המסקנות בקוד ותיקון השגיאות שלו מגיעים לרמה של GPT-4o. מעבר לכתיבת קוד רגילה, הוא שומר על יכולות מתמטיות ונועד לשמש תשתית לסוכני פיתוח אוטונומיים.

בגרסת ה־GGUF הנוכחית מקבלים חלון הקשר מלא של 32,768 טוקנים. היתרון הגדול פה הוא האפשרות להריץ מודל עם יכולות חזקות מאוד בלי להיות תלויים בשרתים חיצוניים, אבל צריך לזכור שמדובר ב־32B, כך שהוא עדיין דורש משאבים משמעותיים בהשוואה לגרסאות הקטנות בסדרה.

מתאים ל

  • סוכן בדיקות ותיקון שגיאות

    מתאים לאיתור באגים ותיקון קוד מורכב בריצה מקומית ומאובטחת בתוך הארגון.

  • כתיבת פונקציות וקוד שלם

    מאפשר יצירת קוד מאפס ברמת דיוק גבוהה שמכוונת להשתוות למודלים המובילים בשוק.

  • פתרון בעיות מתמטיות

    שומר על יכולת חישובית והסקה לוגית לצד כתיבת הקוד עצמו.

איפה זה נופל

למרות שהסדרה תומכת עקרונית בהרחבת הקשר עד 128K טוקנים באמצעות YARN, בגרסת ה־GGUF התמיכה מוגבלת ל־32,768 טוקנים בלבד, כי ההרחבה נתמכת כרגע רק ב־vLLM. אם אתם צריכים לנתח קבצי ענק מעבר לזה, תצטרכו לעבור לגרסה הרגילה. בנוסף, מודלים מכווצים בגודל כזה עלולים לאבד דיוק ברמות הכימות הנמוכות, וחובה לבדוק את הקוד שהוא מייצר לפני שמריצים אותו בסביבה חיה.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה הקובץ שירד לא עובד לי מיד?

הקבצים הגדולים מחולקים לכמה חלקים עקב מגבלות העלאה. צריך להשתמש בפקודה llama-gguf-split שמגיעה עם llama.cpp כדי לאחד אותם לקובץ בודד לפני ההרצה.

האם אפשר להשתמש בחלון הקשר של 128K טוקנים?

לא בגרסה הזו. הרחבת ההקשר מעבר ל־32,768 טוקנים מבוססת על YARN ונתמכת כרגע רק ב־vLLM עבור המודלים שאינם בפורמט GGUF.

איך מריצים

את המודל מריצים ישירות דרך llama.cpp, כשיש אפשרות להוריד רמות כימות שונות, מ־q2_K הנמוך ועד q8_0 הכבד, דרך huggingface-cli. קבצים גדולים במיוחד מגיעים מפוצלים ומחייבים איחוד בעזרת הכלי llama-gguf-split לפני השימוש הראשון.

גרסה מאוזנת כמו q4_K_M או q5_K_M תדרוש כרטיס מסך עם לפחות 24GB זיכרון או שילוב חזק של מעבד ו־RAM מהיר. אם אין לכם חומרה כזו פנויה או שאתם מחפשים מענה מהיר להרבה משתמשים במקביל, שווה לבדוק שימוש ב־API במקום להחזיק שרת ייעודי.

ollama run hf.co/Qwen/Qwen2.5-Coder-32B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

46 קבצים במאגר, 386 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗