GPT
Q

Qwen2.5-Coder-32B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02024-11-09

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • code

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל קוד שמיועדת להרצה עצמית בלי לשלם על שרתים מפלצתיים. הוא מביא יכולות פיתוח חזקות מאוד בגודל שנכנס לכרטיס מסך בודד של 24 גיגה.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 1,465,778הורדות בחודש

מה זה

זה מודל קוד של 32 מיליארד פרמטרים שעבר כיול בשיטת AWQ לדיוק של 4 ביט, מה שמוריד את המשקל שלו לכ־18 גיגה. המפתחים אימנו אותו על 5.5 טריליון טוקנים של קוד, טקסט ונתונים סינתטיים, ומצהירים שביכולות ייצור הקוד, ההיסק ותיקון הבאגים הוא מתחרה ב־GPT-4o, לצד שמירה על ביצועים במתמטיקה.

בגרסה הזו המטרה היא לקבל את רמת החשיבה של מודל 32B בלי הדרישה למערך של מספר כרטיסים גרפיים. הוא מיועד למשימות של כתיבת קוד מלאה, עבודה בתוך סוכני תוכנה ופתרון בעיות לוגיות מורכבות, ופונה ישירות למי שרוצה ביצועים ברמה גבוהה בהרצה עצמית.

מתאים ל

  • השלמת קוד מקומית

    מתאים לשרת פנימי בארגון שדורש פרטיות מלאה, ומספק יכולות פיתוח חזקות על גבי חומרה צנועה של כרטיס בודד.

  • סוכני פיתוח ותיקון באגים

    מתאים לריצה כחלק מתהליך CI אוטומטי שמנתח לוגים, מזהה כשלים ומציע תיקוני קוד עם יכולת היסק גבוהה.

  • סקירת קוד לפרויקטים בינוניים

    ניתוח של פונקציות וקבצים שלמים במסגרת 32K טוקנים כדי לאתר בעיות אבטחה וסגנון בלי להוציא קוד החוצה.

איפה זה נופל

ברירת המחדל של חלון ההקשר היא 32,768 טוקנים. כדי להגיע ל־128K צריך להפעיל מנגנון הרחבה בשם YaRN בתוך הקונפיגורציה, ובמנועים כמו vLLM ההרחבה הזו היא סטטית. המפתחים עצמם מזהירים שהפעלה קבועה של ההרחבה עלולה לפגוע באיכות התשובות על טקסטים וקודים קצרים, כך שלא כדאי להדליק אותה סתם.

בנוסף, המודל מוגדר רשמית לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו להבנה עמוקה של פרומפטים מורכבים או הערות בעברית.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם הוא באמת יכול לעבוד על כרטיס RTX 4090 של 24GB?

כן, משקל הקבצים הוא 18 גיגה כך שהמשקלים עצמם נכנסים בקלות לזיכרון. עם זאת, זיכרון ה־KV לוקח מקום נוסף, כך שאם תשלחו פרומפטים ארוכים מאוד שמתקרבים לקצה ההקשר, תצטרכו לנהל את הזיכרון בזהירות דרך vLLM כדי לא לקבל שגיאת זיכרון.

איך אפשר להשתמש בחלון המלא של 128K טוקנים?

צריך להגדיר בהגדרות המודל rope_scaling מסוג yarn עם פקטור 4.0. קחו בחשבון שזה דורש יותר זיכרון עבור ההקשר, ושבמנועים מסוימים זה עלול לפגוע בביצועים על קטעי קוד קצרים, ולכן עדיף להפעיל את זה רק כשיש צורך ממשי בקבצים ענקיים.

איך מריצים

בזכות הכיווץ ל־4 ביט, אפשר להריץ אותו על כרטיס יחיד עם 24 גיגה זיכרון כמו RTX 3090, RTX 4090 או A10G בענן. בשביל להריץ אותו דרך ספריית transformers צריך גרסה 4.37.0 ומעלה כדי שהארכיטקטורה תזוהה, אבל בייצור עדיף להשתמש במנוע כמו vLLM שמנצל טוב יותר את ה־AWQ.

אם אין לכם כרטיס כזה זמין או שאתם לא רוצים לנהל תשתית והקצאת זיכרון, עדיף לפנות ל־API חיצוני. החומרה הנדרשת אמנם נגישה, אבל ניהול מודל כזה תחת עומס עדיין דורש תחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-Coder-32B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים סגורים. הדרישה העיקרית היא לכלול את תנאי הרישיון המקוריים ומתן קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗