GPT
Q

Qwen2.5.1-Coder-7B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-11-06

  • gguf
  • code
  • codeqwen
  • chat
  • qwen

גרסת GGUF מכווצת של מודל קוד בגודל שבעה מיליארד פרמטרים. היא מיועדת למי שרוצה להריץ עוזר פיתוח עצמאי ישירות על החומרה המקומית בלי לשלוח שורות קוד לשרת חיצוני.

  • 113 GBמשקל הקבצים
  • 6,324הורדות בחודש
  • 124לייקים

מה זה

מדובר בהמרה של מודל ההוראות לקוד מבית Qwen לפורמט GGUF בעזרת llama.cpp, שביצע המשתמש bartowski. המודל מתמקד ביצירת קוד, השלמת תחביר ועבודה לפי הוראות מוגדרות בשפה האנגלית, תוך שימוש בתבנית שיחה של ChatML. כל הקבצים הוכנו בשיטת כיול imatrix כדי לצמצם אובדן איכות בזמן הדחיסה.

היתרון המרכזי כאן הוא היחס שבין נפח הזיכרון לדיוק בקוד. ברמת שבעה מיליארד פרמטרים, המודל הזה מתחרה ישירות בכלים מקומיים אחרים ומציע חלופה מעשית למי שאינו יכול להריץ מודלי ענק של שבעים מיליארד פרמטרים, אך עדיין זקוק לתחביר תקין במגוון שפות פיתוח.

מתאים ל

  • עוזר השלמת קוד מקומי

    מאפשר קבלת פונקציות והשלמות תחביר בזמן אמת בתוך סביבת הפיתוח, בלי להוציא קוד החוצה.

  • הסבר ובדיקת קטעי קוד

    מנתח פונקציות קצרות, מוצא שגיאות תחביר בסיסיות ומייצר תיעוד מהיר באנגלית.

  • הרצה על חומרת קצה

    נפח של פחות מחמישה גיגה בייט בגרסאות הביניים מאפשר הפעלה חלקה גם במחשבים ניידים ללא שרת.

איפה זה נופל

זהו מודל של שבעה מיליארד פרמטרים בלבד, והוא אינו מחליף מודלים ענקיים במשימות ארכיטקטורה מורכבות או בהבנת פרויקטים שלמים. גרסאות הדחיסה האגרסיביות, כמו אלו שמתחת ל־4 ביט ובראשן משפחת Q2 או IQ2, סובלות מירידה ניכרת באיכות ועלולות לייצר שגיאות תחביר והזיות בקוד. בנוסף, המודל מוגדר ומאומן באנגלית, כך שאין לצפות לביצועים טובים בהוראות או בהערות בעברית.

שאלות
נפוצות

האם צריך להוריד את כל 113 הגיגה בייט של המאגר?

לא. המאגר מכיל 27 קבצים שונים שכל אחד מהם מייצג רמת כיווץ אחרת. מורידים רק קובץ GGUF יחיד לפי כמות הזיכרון שיש לכם במחשב.

איזו גרסה מומלצת להתחלה?

קובץ Q4_K_M במשקל 4.68GB הוא ברירת המחדל המתאימה לרוב המשתמשים. הוא שומר על איכות טובה מול משקל נמוך שנכנס לרוב כרטיסי המסך המודרניים.

האם אפשר להשתמש בגרסאות ה־ARM על מחשבי Mac?

לא. יוצר המאגר מציין במפורש שגרסאות Q4_0_X_X מיועדות למעבדי ARM ייעודיים בלבד ואינן מתאימות למחשבי חלונות או מק.

איך מריצים

להרצה מקומית בתוכנות כמו LM Studio או llama.cpp, בוחרים קובץ בודד בלבד מתוך המאגר. לרוב כרטיסי המסך הביתיים בעלי 8GB זיכרון, גרסת Q4_K_M במשקל 4.68GB תעבוד מצוין, תיכנס כולה לזיכרון הגרפי ותיתן קצב עבודה מהיר. מי שמחזיק מעבד ARM יכול לבדוק את גרסאות Q4_0_4_4 הייעודיות, אך הן אינן מתאימות למחשבי חלונות או מק.

אם אין לכם כרטיס מסך מתאים והמערכת נאלצת לפנות לזיכרון הראשי, זמני התגובה יהיו אטיים מאוד. במצב כזה, או בעבודה על פרויקטים כבדים הדורשים מעקב אחרי תיקיות שלמות, עדיף להשתמש בחיבור API מרוחק מאשר להריץ את המודל מקומית.

ollama run hf.co/bartowski/Qwen2.5.1-Coder-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה מחדש במוצרים סגורים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗