GPT
Q

Qwen2.5-Coder-32B

קוד פתוח

Qwenapache-2.02024-11-08

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • code

יש כאן גם סקירה על Qwen עצמו.

גרסת בסיס של 33 מיליארד פרמטרים שמתמקדת בקוד, ומציעה ביצועים ברמה של מודלים סגורים מובילים. מתאימה למי שרוצה לאמן או לכוונן מודל פיתוח חזק משלו.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 1,699הורדות בחודש

מה זה

מדובר במודל בסיס שנועד לתכנות, הסקת מסקנות בקוד ותיקון שגיאות, ואומן על 5.5 טריליון טוקנים של קוד, נתונים סינתטיים וטקסט טכני. המפתחים שלו מצהירים שיכולות הכתיבה שלו משתוות לאלו של GPT-4o, לצד שימור יכולות מתמטיות כלליות שנדרשות למשימות מורכבות כמו סוכני פיתוח אוטונומיים.

ברירת המחדל עומדת על 32,768 טוקנים, אבל הארכיטקטורה תומכת בהרחבה עד 131,072 טוקנים באמצעות מנגנון YaRN. זה נותן מענה למי שצריך להזין ספריות שלמות או מסדי נתונים שלמים של קוד בלי לחתוך קבצים באמצע.

ההבדל המרכזי מול מה שהכרנו בסדרה הקודמת הוא היקף הדאטה והיכולת לתפקד כשלד גולמי למשימות המשך. הוא מגיע במשקל נקי ומיועד למי שלא מחפש צ'אט מוכן, אלא שכבת יסוד לביצוע אימונים ממוקדים או השלמות קוד פנימיות.

מתאים ל

  • אימון מודל פנימי

    משמש בסיס מצוין לכוונון עדין על בסיס הקוד של החברה, במקום להתחיל מודל מאפס.

  • השלמת קוד בקבצים

    מבצע משימות fill in the middle ישירות בתוך קבצי מקור בלי צורך במבנה של שיחה.

  • סוכני פיתוח מותאמים

    כולל בסיס חזק בהסקה מתמטית וקוד, שמתאים לבניית כלי אוטומציה לאחר אימון ייעודי.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה מכוונן, והמפתחים מצהירים במפורש שהוא לא מיועד לצ'אט בלי אימון מקדים נוסף כמו SFT או RLHF. הוא לא יענה לשאלות כמו מתכנת אנושי אלא פשוט ימשיך את הטקסט או הקוד שקיבל.

בעיה נוספת נובעת מהרחבת ההקשר. vLLM תומך כרגע רק ב־YaRN סטטי, מה שאומר שהפעלת ההרחבה מעבר ל־32 אלף טוקנים פוגעת ישירות באיכות הביצועים על קטעי קוד קצרים. בנוסף, המודל אומן ותועד באנגלית בלבד.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להשתמש בו ישירות כעוזר פיתוח בסביבת העבודה שלי?

לא מומלץ בכלל. זהו מודל בסיס שלא עבר כוונון להוראות, ולכן הוא ינסה להשלים את השורות הבאות במקום לענות להוראות מפורשות.

כדאי להפעיל את ההרחבה ל־128K טוקנים מראש?

רק אם יש צורך ממשי בקריאת קבצים ענקיים. המימוש הסטטי הנוכחי עלול לפגוע באיכות הפלט במשימות קוד רגילות וקצרות.

איך מריצים

המשקל הכולל של הקבצים עומד על 61 גיגה בייט בפורמט bfloat16, כך שצריך כרטיס גרפי מקצועי של 80 גיגה בייט לפחות, או שילוב של מספר כרטיסים, רק כדי להעלות אותו לזיכרון. הרצה בסביבת vLLM נתמכת, ודורשת גרסת transformers עדכנית מעל 4.37.0 כדי לא להיתקל בשגיאות זיהוי של הארכיטקטורה.

אם אין לכם שרת ייעודי כזה בחברה, החזקה שלו בענן תעלה לא מעט כסף בכל שעה. במצב כזה, פנייה לפתרון שמגיש אותו דרך API חיצוני תהיה זולה ופשוטה משמעותית מהרמה עצמית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-Coder-32B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מלא וחופשי. אתם יכולים לקחת את המשקלים, לשנות אותם, לאמן עליהם, לשלב אותם במוצר מסחרי סגור ולמכור אותו ללקוחות בלי לשלם תמלוגים, כל עוד אתם מצרפים עותק של הרישיון וההודעות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗