GPT
Q

Qwen2.5-14B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF מכווצת של מודל ההוראות מבית עליבאבא, שמציעה נקודת איזון מצוינת בין גודל של 14 מיליארד פרמטרים ליכולת ריצה מקומית על כרטיסי מסך סטנדרטיים.

  • 217 GBמשקל הקבצים
  • 66,547הורדות בחודש
  • 71לייקים

מה זה

מדובר בהמרה של Qwen2.5-14B-Instruct לפורמט GGUF באמצעות llama.cpp, שביצע bartowski בעזרת כיול imatrix. המודל שומר על היכולות של המקור במעקב אחר הנחיות מורכבות, כתיבת קוד והבנת טקסט, אבל מאפשר להריץ אותו בלי שרת ייעודי כבד. גודל של 14B נחשב לאזור אידיאלי שמציג קפיצת מדרגה אמיתית בהיגיון וביציבות מול דגמי 7B ו־8B, בלי לדרוש מערך חומרה כפול של ארגונים.

בגרסה הזו bartowski מציע שורה ארוכה של רמות דחיסה שונות, החל מקבצים של 5.36 גיגה בייט ועד משקל מלא של 29.55 גיגה בייט. בחלק מהגרסאות, כמו Q4_K_L, שכבות הפלט וההטמעה נשמרו באיכות גבוהה של שמונה ביט כדי לצמצם שגיאות ניסוח שמאפיינות מודלים מכווצים.

מתאים ל

  • עוזר פיתוח מקומי

    מספק יכולות תכנות טובות משמעותית ממודלי 8B, ורץ מקומית על כרטיס RTX בודד בלי לשלוח קוד החוצה.

  • ניתוח מסמכים בארגון

    מאפשר לעבד נתונים רגישים על שרת פנימי ללא תלות בענן, ברישיון אפאצ'י שמאפשר שילוב במערכות פנימיות.

  • סוכן אוטונומי קל

    גודל 14B מחזיק לוגיקה עקבית בהפעלת כלים לפי תבנית im_start, בלי להזדקק למשאבים של מודלי ענק.

איפה זה נופל

הגרסאות הדחוסות ביותר, כמו אלו מתחת לשלושה ביט, מאבדות דיוק בצורה מורגשת ונוטות להזיות ולתחביר שבור, ולכן לא הייתי מסתמך עליהן במוצר שדורש יציבות. מעבר לכך, פורמט I-quants החדש יותר אומנם חוסך מקום אבל רץ לאט יותר על מעבדי אפל ומעבדים מרכזיים, ואינו נתמך כלל במנועי Vulkan של AMD.

המטא-דאטה מציג תמיכה בשפה האנגלית בלבד. אף שהמודל המקורי מתמודד לא רע עם שפות נוספות, צריך לבדוק אותו ביסודיות מול טקסטים בעברית כדי לוודא שאין בריחת אותיות או חוסר הבנה של ניואנסים מקומיים לפני שמחברים אותו למערכת פעילה.

אותה משפחה

Qwen2.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

ברירת המחדל הטובה ביותר היא Q4_K_M ששוקל קרוב לתשעה גיגה בייט ומתאים לכרטיסי מסך עם 12 גיגה זיכרון. אם יש לכם כרטיס עם 16 גיגה או יותר, קחו את Q6_K או Q5_K_M שמציעים דיוק גבוה יותר כמעט ללא פגיעה בביצועים.

האם המודל ירוץ מהר על מחשבי מק עם שבבי אפל?

הוא יעבוד, אבל גרסאות ה־IQ החדשות עובדות לאט יותר על מעבדי אפל ביחס ל־K-quants הרגילים. בנוסף, גרסאות ה־Q4_0_X_X שמותאמות ל־ARM אינן מתאימות למנגנון Metal של אפל, לכן מומלץ לבחור בגרסת K סטנדרטית כמו Q4_K_M.

איך מריצים

הקובץ המומלץ לרוב השימושים הוא Q4_K_M במשקל 8.99 גיגה בייט, שנכנס בקלות לכרטיס מסך של 12 גיגה זיכרון יחד עם הקשר עבודה בסיסי. אם יש לכם כרטיס עם 16 גיגה זיכרון, עדיף לקחת את Q5_K_M או Q6_K כדי למזער אובדן דיוק. מריצים אותו ישירות בתוכנות כמו LM Studio או דרך llama.cpp, ותבנית השיחה דורשת תגיות im_start ו־im_end מסודרות כדי לעבוד נכון.

למי שיש חומרה מבוססת ARM קיימות גרסאות ייעודיות כמו Q4_0_4_4 שנותנות קצב ריצה מהיר יותר במעבדים אלה, אך הן אינן מיועדות להאצת Metal של אפל. אם המטרה היא להריץ חלונות הקשר מקסימליים או לתת מענה לעשרות משתמשים במקביל, עדיף לצרוך את המודל דרך ספק API ולא לנסות להחזיק אותו על חומרה ביתית.

ollama run hf.co/bartowski/Qwen2.5-14B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים המקורית וצירוף עותק של הרישיון, ללא דרישה לשחרר את קוד המוצר שלכם או לשלם תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗