GPT
Q

Qwen2.5-Coder-32B-Instruct-128K-GGUF

קוד פתוח

unslothapache-2.02024-11-12

  • transformers
  • gguf
  • qwen2
  • unsloth
  • code

גרסת GGUF ייעודית לקוד עם 32 מיליארד פרמטרים והרחבת הקשר של 128K טוקנים. פתרון מקומי חזק למי שרוצה יכולות פיתוח מתקדמות בלי להוציא נתונים החוצה.

  • 124 GBמשקל הקבצים
  • 4,857הורדות בחודש
  • 80לייקים

מה זה

מדובר במודל שמכוון ישירות למשימות תכנות, פתרון באגים ובניית סוכני קוד. המפתחים אימנו אותו על 5.5 טריליון טוקנים שכוללים קוד מקור ומידע סינתטי, כשהייחוד של המאגר הזה הוא השילוב של ארכיטקטורת YaRN שדוחפת את חלון ההקשר עד 131,072 טוקנים מלאים.

בכרטיס המודל טוענים שביצועי הקידוד שלו מגיעים לרמה של GPT-4o, לצד שימור יכולות מתמטיות. במקום להסתפק בהשלמות קוד נקודתיות, הארכיטקטורה של 64 שכבות ושימוש ב־GQA מאפשרים לנתח קבצי פרויקט שלמים בתוך זיכרון ההקשר המורחב, בתנאי שיש לכם את הברזלים המתאימים לזה.

מתאים ל

  • ניתוח בסיס קוד גדול

    הקשר של 128K טוקנים מאפשר להזין מספר קבצים במקביל כדי למצוא באגים או לתכנן שינויים רוחביים.

  • סוכני פיתוח אוטונומיים

    האימון מתמקד במעקב אחרי הנחיות מורכבות, מתמטיקה ופתרון בעיות עבור כלי פיתוח עצמאיים.

  • השלמת קוד מקומית ומאובטחת

    מתאים לארגונים שלא יכולים לשלוח קוד פנימי ל־API חיצוני ומחזיקים שרתים עם זיכרון גרפי מתאים.

איפה זה נופל

חלון הקשר של 128K טוקנים דורש משאבי זיכרון אדירים בשלב ה־KV Cache, ובלעדיהם המודל יקרוס או יעבוד בקצב לא שמיש. בנוסף, המודל מתועד רשמית רק באנגלית, כך שאין שום הבטחה להבנה או כתיבה תקינה של הערות ותיעוד בעברית, וסביר שתקבלו פלט שבור בניסיון כזה.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב נייד רגיל?

לא. מודל של 32 מיליארד פרמטרים דורש זיכרון RAM ו־VRAM משמעותיים, במיוחד אם מנצלים את מלוא חלון ההקשר של 128K. על מחשב ללא כרטיס מסך ייעודי חזק המודל יעבוד לאט מאוד או ייעצר מחוסר זיכרון.

באיזו ספריית קוד צריך להשתמש כדי לטעון אותו?

הפרויקט מתבסס על transformers מגרסה 4.37.0 ומעלה. גרסאות ישנות יותר יזרקו שגיאת KeyError על ארכיטקטורת qwen2 ולא יצליחו לקרוא את המשקלים.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־124 גיגה-בייט שמחולקים בין קבצים שונים. כדי להריץ מודל של 32 מיליארד פרמטרים בהקשר של 128K טוקנים, תצטרכו כרטיס מסך חזק מאוד עם לפחות 24 עד 48 גיגה זיכרון וידאו, או חלוקה בין זיכרון המערכת לכרטיס המסך תוך פגיעה במהירות היצירה.

אם אתם צריכים רק תיקוני פונקציות קצרים ולא קריאת תיקיות שלמות, עדיף לבדוק את הגרסה הרגילה של 32K. כשאין ברשותכם שרת ייעודי חזק, התקנת סביבה כזו לבד תהיה איטית ויקרה יותר מפנייה ישירה לשירותי ענן.

ollama run hf.co/unsloth/Qwen2.5-Coder-32B-Instruct-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗