GPT
Q

Qwen2.5-Coder-32B-Instruct

קוד פתוח

Qwenapache-2.02024-11-06

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • code

יש כאן גם סקירה על Qwen עצמו.

מודל קוד פתוח שמכוון ישירות לביצועי פיתוח ברמה של מודלים סגורים מובילים. הוא מיועד למי שרוצה יכולות תכנות כבדות על תשתית עצמאית בלי לשלוח קוד החוצה.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 1,603,991הורדות בחודש

מה זה

מדובר במודל הדגל מסדרת הקוד של Qwen, שאומן על 5.5 טריליון טוקנים הכוללים קוד מקור ונתונים סינתטיים. המטרה שלו ברורה, להתמודד עם משימות כתיבה, תיקון והסבר של קוד מורכב. לפי נתוני היוצרים, היכולות שלו בקידוד משתוות לאלו של GPT-4o, לצד שמירה על חוזק במתמטיקה ובמשימות כלליות.

הוא בנוי כמודל שיחה והוראות בארכיטקטורת Qwen2 עם 64 שכבות ושימוש ב־GQA לחיסכון במשאבים. ברירת המחדל שלו מוגדרת ל־32,768 טוקנים, אבל תומכת בהרחבה עד 128K טוקנים באמצעות מנגנון YaRN, מה שמאפשר להזין לו קבצי קוד שלמים או תיעוד טכני נרחב לצורך ניתוח ובניית סוכני קוד אוטונומיים.

מתאים ל

  • סוכן לפיתוח ותיקון באגים

    אינטגרציה לתוך סביבות עבודה לניתוח שגיאות בזמן אמת, כתיבת בדיקות יחידה והשלמת קוד מתקדמת.

  • ניתוח בסיסי קוד גדולים

    הזנת מודולים שלמים עם הגדרת הקשר מורחבת של עד 128K טוקנים למיפוי תלויות וארכיטקטורה.

  • שרת השלמת קוד מקומי ומאובטח

    הרצה בארגונים שאינם מורשים להוציא קוד קנייני לשרתי צד שלישי ומחפשים ביצועים גבוהים.

איפה זה נופל

הנקודה הרגישה ביותר היא הרחבת ההקשר. המודל אמנם תומך בעד 128K טוקנים, אך שימוש ב־YaRN במנועים כמו vLLM מפעיל הרחבה סטטית קבועה. היוצרים מזהירים במפורש שזה עלול לפגוע בביצועים של המודל בטקסטים קצרים, ולכן לא מומלץ להדליק את ההגדרה הזו אם אין צורך מפורש בקלט ארוך.

בנוסף, הכרטיס מדווח על תמיכה באנגלית בלבד. זה אומר שלא כדאי להסתמך עליו בהבנת דרישות או הערות בעברית, וספריית transformers ישנה מגרסה 4.37.0 פשוט תיכשל בטעינה עם שגיאת מפתח.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח רגיל?

במשקל המלא שלו לא. הקבצים שוקלים 61 ג'יגה בייט ודורשים חומרת שרתים ייעודית עם זיכרון וידאו נרחב. במחשב אישי תצטרכו להסתפק בגרסאות מכווצות מאוד או במודלים הקטנים יותר בסדרה.

למה שהמודל יאבד דיוק אם אני פותח לו את חלון ההקשר המלא?

הטכניקה שמאפשרת חלון מעבר ל־32K טוקנים מבצעת מתיחה סטטית של ייצוג המיקום. השינוי הקבוע הזה מחליש את רמת הדיוק כשהקלט קצר, ולכן היצרן ממליץ להפעיל אותה רק כשממש חייבים.

איך מריצים

כדי להריץ אותו במשקל המקורי של 61 ג'יגה בייט בפורמט bfloat16, תצטרכו לפחות שני כרטיסי A100 או כרטיס בודד של 80GB, וגם זה בקושי. לסביבת עבודה מקומית שפויה, הפתרון הריאלי הוא להשתמש בגרסאות מכווצות דרך vLLM או סביבות תואמות, אחרת החומרה הנדרשת יקרה מאוד.

אם אין לכם קלאסטר זמין או צורך קריטי בסודיות מוחלטת של הקוד הפנימי, לרוב יהיה משתלם ופשוט יותר לצרוך אותו דרך ספק צד שלישי שמציע API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-Coder-32B-Instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או חיצוניים ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים והתנאים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗