GPT
Q

bartowski/Qwen2.5-Coder-7B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-09-17

  • transformers
  • gguf
  • code
  • codeqwen
  • chat

גרסה מכווצת של מודל קוד שמביאה ביצועים של מודלים גדולים לחומרה מקומית צנועה יחסית. הוא מתאים למי שרוצה השלמות קוד פרטיות בלי לשלם על שרתים יקרים או לחשוף מידע לשירות חיצוני.

  • 113 GBמשקל הקבצים
  • 52,310הורדות בחודש
  • 72לייקים

מה זה

מדובר בהמרה של מודל ההוראות לקוד מבית Qwen לפורמט GGUF, כשהמטרה היא לאפשר הרצה על מעבדים ביתיים או כרטיסי מסך סטנדרטיים באמצעות llama.cpp וכלים דמויי LM Studio. היוצר, bartowski, השתמש בכיול מבוסס imatrix כדי לצמצם את הפגיעה באיכות בזמן הדחיסה. הדגש כאן הוא על יצירת קוד והבנת הנחיות פיתוח באנגלית, בתבנית צ'אט מוגדרת היטב.

המשקל של הקבצים נע בין 2.78 גיגה בגרסת IQ2_M המינימלית ועד 15.24 גיגה בגרסת f16 המלאה. המגוון הגדול מאפשר להתאים את רמת הדחיסה בדיוק לזיכרון הפנוי. ברמות הדחיסה הבינוניות כמו Q4 או Q5, הדגם שומר על יכולות הקידוד המקוריות שלו ומספק פתרון מקומי מהיר בלי צורך להחזיק תחנת עבודה ייעודית.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    מאפשר לייצר פונקציות והשלמות שורות במהירות מתוך העורך, בלי לשלוח שורות קוד סודיות לשרתים חיצוניים.

  • כתיבת בדיקות יחידה

    יודע לקבל בלוק של קוד קיים ולפלוט בדיקות תואמות, משימה שמתאימה מאוד למודל הוראות ממוקד פיתוח.

  • פיתוח על מחשבי ARM

    כולל גרסאות Q4_0_X_X מותאמות במיוחד שמנצלות חומרת ARM לקבלת מהירות עבודה סבירה ללא כרטיס גרפי ייעודי.

איפה זה נופל

הקבצים הזעירים שמתחת ל־4 ביט, כמו IQ2_M או Q2_K, מוגדרים אפילו בתיעוד כבעלי איכות נמוכה מאוד, והם עלולים לייצר קוד שבור, הזיות תחביריות ובאגים שקטנים לקלוט בעין. בנוסף, מדובר במודל 7B, כך שגם בדיוק מלא יש גבול ליכולת שלו לתכנן ארכיטקטורות מורכבות או להחזיק קבצי פרויקט ענקיים בלי לטעות.

המודל מתועד באנגלית בלבד, לכן לא כדאי לבנות עליו לניתוח דרישות או תיעוד בעברית. לפני שמחברים אותו לכלי עבודה יומי, צריך לבדוק אותו על שפת התכנות הספציפית שלכם ולוודא שהקוד שהוא מייצר אכן מתקמפל ועובר בדיקות בסיסיות.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

לרוב המשתמשים כדאי להתחיל עם Q4_K_M ששוקל 4.68 גיגה. הוא נותן פשרה מוצלחת בין מהירות, ניצול זיכרון ודיוק תחבירי בקוד. אם יש לכם כרטיס עם 8 גיגה ומעלה, Q5_K_M ייתן תוצאה מדויקת יותר בתוספת נפח קטנה.

האם חייבים כרטיס מסך של Nvidia כדי להשתמש בו?

לא. המודל רץ ישירות דרך llama.cpp או LM Studio גם על המעבד המרכזי וה־RAM של המחשב. כרטיס מסך יעזור מאוד למהירות ההפקה, אך הגרסאות הקלות מאפשרות עבודה בסיסית גם על חומרה ללא מאיץ ייעודי.

האם גרסאות ה־ARM מתאימות למחשבי Mac עם שבבי Apple Silicon?

לא. התיעוד מציין במפורש שהגרסאות המיוחדות ל־ARM אינן מיועדות להרצה עם Metal של אפל. למחשבי Mac עדיף לבחור בגרסאות ה־K הרגילות כמו Q4_K_M או Q5_K_M שעובדות היטב עם המאיץ הגרפי של המערכת.

איך מריצים

כדי להריץ אותו בנוחות, מורידים קובץ בודד שמתאים לחומרה שלכם ולא את כל המאגר. למי שמחפש איזון, גרסת Q4_K_M שוקלת 4.68 גיגה ודורשת כרטיס מסך עם לפחות 6 או 8 גיגה זיכרון כדי לרוץ כולה בתוך ה־VRAM ולקבל מהירות תגובה טובה. מעבדי ARM יכולים להשתמש בגרסאות הייעודיות מסדרת Q4_0_X_X שכוללות האצה מותאמת, אך הן לא מיועדות למערכות Metal של אפל.

אם יש לכם פחות מ־6 גיגה זיכרון זמין, אפשר לרדת ל־IQ3_M או Q3_K_M, אבל איכות הקוד תרד. במקרים שבהם המחשב חלש מאוד או שחייבים דיוק מקסימלי במשימות תכנות כבדות, עדיף להשתמש ב־API מרוחק של המודל המקורי ולא להתעקש על הרצה מקומית צולעת.

ollama run hf.co/bartowski/Qwen2.5-Coder-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗