GPT
Q

Qwen2.5-Coder-14B-Instruct

קוד פתוח

Qwenapache-2.02024-11-06

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • code

יש כאן גם סקירה על Qwen עצמו.

גרסת 14B ממוקדת קוד שמיועדת לספק כוח חישוב רציני בלי לשבור את התקציב. פתרון ביניים חזק למי שמחפש יכולות תכנות גבוהות על חומרה מקומית נגישה.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 1,922,286הורדות בחודש

מה זה

מדובר במודל שפה ייעודי לקוד שעבר אימון על 5.5 טריליון טוקנים שכוללים קוד מקור, נתונים סינתטיים וטקסט טכני. הוא תוכנן לתת מענה ממוקד למשימות של יצירת קוד, הסקת מסקנות לוגית ותיקון באגים, לצד שמירה על יכולות במתמטיקה ובמשימות שפה כלליות. הגודל שלו, כמעט 15 מיליארד פרמטרים, ממקם אותו בדיוק בנקודת האמצע בין המודלים הקטנים שמתקשים בקוד מורכב לבין המפלצות שדורשות שרתים ייעודיים.

הוא מגיע עם ארכיטקטורה מודרנית שכוללת מנגנון תשומת לב מסוג Grouped Query Attention, מה שמסייע בניהול זיכרון יעיל בזמן עיבוד טקסטים ארוכים. ברירת המחדל מוגדרת לטווח של 32,768 טוקנים, אך בעזרת מנגנון הרחבה אפשר להגיע עד 128K טוקנים. זה הופך אותו למתאים במיוחד לבניית סוכני קוד שצריכים לקרוא ספריות שלמות ולהחזיק הקשר רחב בלי לקרוס.

מתאים ל

  • בניית סוכני קוד אוטונומיים

    שילוב יכולות מתמטיקה ותכנות שמאפשר למודל לתכנן צעדים, לכתוב סקריפטים ולתקן שגיאות ריצה.

  • ניתוח ופתרון באגים

    אימון ייעודי לתיקון קוד שמאפשר לו לאתר שגיאות לוגיות עדינות בקבצים ארוכים ולהציע תיקון ישיר.

  • עבודה מול מאגרי קוד בינוניים

    חלון בסיס של 32K טוקנים שקולט תיקיות פרויקט שלמות בלי צורך בטכניקות חלוקה מורכבות.

איפה זה נופל

הבעיה המרכזית נמצאת בהרחבת ההקשר מעבר לטווח הבסיס. הכרטיס מציין בפירוש ששימוש בטכניקת YaRN לצורך הגעה להקשר ארוך בתוכנת vLLM מפעיל מקדם קבוע שעלול לפגוע באיכות הפלט בטקסטים קצרים. בנוסף, המודל אומן והוגדר רשמית עבור אנגלית, כך שאין שום הבטחה לגבי איכות הקוד כשההנחיות או ההערות נכתבות בעברית. חובה להשתמש בגרסת transformers עדכנית, אחרת הוא פשוט זורק שגיאה בעלייה.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי להפעיל תמיד את התמיכה בהקשר ארוך של 128K?

עדיף שלא. הפעלת מנגנון YaRN עבור הקשרים ארוכים עלולה לפגוע באיכות התוצאות שלכם בשאילתות קצרות ורגילות, ולכן מומלץ להפעיל אותה רק כשבאמת מזינים קבצים ענקיים.

איזו גרסת ספרייה מינימלית נדרשת להרצה שלו?

חובה לעבוד עם transformers מגרסה 4.37.0 ומעלה. כל גרסה ישנה יותר תיכשל מיד בזיהוי הארכיטקטורה ותחזיר שגיאת מפתח.

איך מריצים

המשקל הגולמי של הקבצים עומד על 27.5 ג'יגה בייט בפורמט bfloat16. כדי להריץ אותו בצורה נקייה בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 32 ג'יגה זיכרון וידאו, או לחלופין לפצל אותו על פני שני כרטיסים קטנים יותר. שימוש בגרסאות מכווצות יאפשר לכם להריץ אותו גם על כרטיסים צרכניים פופולריים עם 16 או 24 ג'יגה זיכרון.

אם אתם מתכוונים להריץ אותו בסביבת ייצור, vLLM היא הבחירה הישירה והמומלצת לפריסה יעילה. עם זאת, אם אין לכם גישה לחומרה כזו באופן קבוע, פנייה לפתרון אירוח מרוחק תהיה פשוטה וזולה יותר מתחזוקת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-Coder-14B-Instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון וזכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗