GPT
Q

Qwen2.5-Coder-3B-Instruct-GGUF

קוד פתוח

Qwenother2024-11-09

  • transformers
  • gguf
  • code
  • codeqwen
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת ומותאמת לקוד שרצה מקומית על מחשב אישי בלי לאכול את כל הזיכרון. היא מיועדת למי שמחפש סיוע בכתיבה ותיקון תוכנה בלי להסתמך על שירותי ענן.

  • 23.5 GBמשקל הקבצים
  • 62,024הורדות בחודש
  • 118לייקים

מה זה

מדובר במודל שפה עם 3.09 מיליארד פרמטרים, שנוצר מראש כדי להתמודד עם קוד, כולל יצירה, הסקת מסקנות ותיקון שגיאות. הוא אומן על 5.5 טריליון טוקנים שכוללים קוד מקור וטקסט, תוך שמירה על יכולות במתמטיקה כדי לאפשר שילוב בכלים כמו סוכני קוד.

הפורמט הנוכחי הוא GGUF, מה שאומר שהוא מוכן לטעינה מהירה דרך מנועים מקומיים. הוא מספק חלון הקשר של 32,768 טוקנים מהקופסה, נתון נדיר ומאוד שימושי לגודל כזה של מודלים, שמאפשר לתת לו פונקציות שלמות או קבצי קוד ארוכים יחסית בלי שיאבד את ההקשר המיידי.

מתאים ל

  • השלמת קוד מקומית

    רץ מהר על חומרה ביתית דרך llama.cpp ומספק הצעות קוד בלי לשלוח שום מידע החוצה לרשת.

  • תיקון באגים בפונקציות

    מתאים לניתוח שגיאות בקטעי קוד ממוקדים בזכות אימון ייעודי על תיקון תוכנה.

  • סוכן לפיתוח אוטומטי

    מחזיק ביכולות מתמטיות והבנת קוד שמאפשרות לו לבצע צעדים מוגדרים מראש בתוך סביבת עבודה.

איפה זה נופל

הקובץ בגרסת GGUF מוגבל לחלון של 32,768 טוקנים. הרחבה של ההקשר עד 131,072 טוקנים עובדת כרגע רק עם vLLM ומודלים שאינם בפורמט הזה, כך שאי אפשר להזין לו קבצים ענקיים מקומית.

בנוסף, הכרטיס מציין אנגלית כשפה נתמכת יחידה. אל תצפו ממנו לעבוד טוב עם הוראות מורכבות או תיעוד בעברית, וצריך לבדוק את איכות הקוד שהוא מייצר במשימות מורכבות כי 3 מיליארד פרמטרים לא מתחרים בדיוק של מודלי ענק.

אותה משפחה

Qwen2.5-Coder יצא ב־18 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם חייבים להוריד את כל הקבצים ששוקלים יחד 23.5 ג'יגה בייט?

ממש לא. המאגר מכיל גרסאות כיול שונות של אותו מודל, וצריך לבחור רק קובץ GGUF אחד שמתאים לכמות הזיכרון שיש לכם במחשב, כמו q5_K_M.

אפשר להריץ אותו בהקשר של מעל 32 אלף טוקנים?

לא בגרסה הזו. הרחבה ל־131,072 טוקנים נתמכת כרגע רק דרך vLLM ובמודלים המקוריים שאינם בפורמט GGUF.

איך המודל מסתדר עם פקודות בעברית?

המודל מוגדר ומאומן בעיקר באנגלית לקוד. ניסוח שאלות בעברית יוביל לתוצאות פחות טובות, ועדיף לתקשר איתו באנגלית בלבד.

איך מריצים

כדי להריץ אותו משתמשים בתוכנת llama.cpp ישירות מהטרמינל. לא מורידים את כל הריפו ששוקל 23.5 ג'יגה בייט, אלא בוחרים קובץ כיול בודד לפי רמת הדיוק שרוצים, כמו q4_K_M או q5_K_M, ומורידים אותו נקודתית.

בגלל הגודל הצנוע, אפשר לזרוק את כל השכבות שלו לזיכרון של כרטיס מסך ביתי פשוט, או אפילו להריץ אותו ישירות על המעבד בלי להרגיש זחילה. אם אתם צריכים לנתח פרויקטי ענק שדורשים מודלים עצומים של 32 מיליארד פרמטרים ומעלה, עדיף לפנות ל־API חיצוני ולא להתעקש על הגודל הזה.

ollama run hf.co/Qwen/Qwen2.5-Coder-3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. זה אומר שיש תנאים ספציפיים שהמפתחים קבעו, ואי אפשר להניח שמותר לשלב אותו במוצר מסחרי באופן חופשי בלי לבדוק את מסמך הרישיון המקורי של יוצרי המודל.

הרישיון המלא בעמוד המודל ↗