GPT
Q

Qwen2.5-Coder-1.5B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-18

  • transformers
  • gguf
  • code
  • codeqwen
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת למודל קוד קטן שרץ ישירות על מעבד של מחשב נייד. פתרון מתאים להשלמת שורות ולסיוע בכתיבת קוד מקומי בלי לשלוח פקודות לשרת חיצוני.

  • 9.1 GBמשקל הקבצים
  • 109,593הורדות בחודש
  • 108לייקים

מה זה

מדובר במודל שפה עם 1.54 מיליארד פרמטרים, שעבר אימון ייעודי על 5.5 טריליון טוקנים של קוד, טקסט ומתמטיקה, ועבר כוונון להוראות. בגרסה הזו הוא מגיע בפורמט GGUF, מה שאומר שהוא מוכן להרצה מקומית יעילה על גבי ספריות כמו llama.cpp.

הוא מתוכנן לתמוך ביצירת קוד, תיקון באגים והבנת לוגיקה תכנותית, לצד משימות בסיסיות של סוכני קוד. למרות הגודל המזערי שלו ביחס למודלי ענק, הוא שומר על יכולות סבירות במתמטיקה ובהבנת טקסט כללי, אך היכולת שלו להתמודד עם ארכיטקטורות מורכבות נשארת מוגבלת עקב כמות הפרמטרים הנמוכה.

מתאים ל

  • השלמת קוד מקומית בעורך

    רץ ישירות על מעבד המחשב ומספק הצעות קצרות בזמן אמת בלי תלות ברשת.

  • בדיקה ותיקון שגיאות תחביר

    מסוגל לאתר שגיאות קטנות בפונקציות בודדות ולהציע תיקון מהיר ומקומי.

  • עבודה בסביבות פיתוח מנותקות

    מתאים לשרתים פנימיים ללא גישה לאינטרנט שדורשים כלי עזר בסיסי לפיתוח.

איפה זה נופל

בגרסת ה־GGUF חלון ההקשר מוגבל ל־32,768 טוקנים, ללא יכולת הרחבה ל־131,072 טוקנים שנתמכת רק בגרסאות הרגילות דרך vLLM עם YARN. בנוסף, מודל של 1.5 מיליארד פרמטרים נוטה לפספס הקשרים בפרויקטים רחבים ולייצר שגיאות בקוד מורכב.

הכרטיס מצהיר על אנגלית כשפה נתמכת, כך שלא כדאי לבנות עליו להסברים בעברית או לתיעוד מקומי. לפני שמכניסים אותו לכלי עבודה, חובה לבדוק את אמינות הקוד שהוא מייצר, במיוחד בספריות לא סטנדרטיות.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעבודה על קבצי קוד ארוכים?

בגרסת ה־GGUF הוא מוגבל להקשר של עד 32,768 טוקנים. אם יש צורך בהקשר המורחב של 131,072 טוקנים, תצטרכו לעבור לגרסה הרגילה ולהריץ אותה דרך vLLM עם תמיכה ב־YARN.

כמה זיכרון דרוש כדי להריץ אותו?

המודל מכיל כ־1.54 מיליארד פרמטרים, כך שבגרסאות קוונטיזציה של 4 או 5 ביט הוא דורש גיגה בייטים בודדים של זיכרון עבודה. אפשר להריץ אותו על מחשב אישי סטנדרטי גם ללא כרטיס מסך ייעודי.

איך מריצים

את המודל מריצים מקומית באמצעות llama.cpp דרך שורת הפקודה, ואין צורך במאיץ גרפי ייעודי כדי לקבל קצב תגובה מהיר. המשקל הכולל של כלל קובצי הקוונטיזציה במאגר הוא 9.1 גיגה בייט, אך בפועל מורידים רק קובץ בודד בהתאם לרמת הדחיסה הרצויה, כמו q4_K_M או q8_0.

קובץ דחוס ברמת 4 ביט תופס מעט מאוד זיכרון עבודה ויכול לרוץ על כמעט כל לפטופ מודרני. אם אתם צריכים אינטגרציה מלאה ופתרון שלם לפרויקט ענק בלי לנהל זיכרון והקשר, כנראה שעדיף לשלם לפי טוקן ל־API של מודל ענן חזק בהרבה.

ollama run hf.co/Qwen/Qwen2.5-Coder-1.5B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מיוחדות על שילוב במערכות פנימיות או מסחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗