GPT
Q

Qwen2.5-14B-Instruct-1M-GGUF

קוד פתוח

bartowskiapache-2.02025-01-25

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF מכווצת של מודל 14B עם חלון של מיליון טוקנים, שמתאימה להרצה מקומית דרך llama.cpp או LM Studio בלי לקרוע את התקציב.

  • 273 GBמשקל הקבצים
  • 2,504הורדות בחודש
  • 48לייקים

מה זה

מדובר במודל הוראות שמבוסס על הארכיטקטורה של Qwen2.5 בגודל 14B, שעבר המרה וכיול בשיטת imatrix על ידי bartowski. היתרון הגדול שלו הוא שילוב של גודל בינוני שעדיין נכנס למאיץ גרפי בודד לצד תמיכה בהקשר של מיליון טוקנים, תכונה ששמורה לרוב למודלי ענק או שירותי ענן סגורים.

המשקלים מגיעים בטווח שנע בין דיוק מלא של 59.09 גיגה בייט ועד גרסאות דחוסות מאוד של 4.70 גיגה בייט. הכרטיס כולל בדיקות השוואה ישנות שנעשו על מודל 3B קטן יותר במעבד EPYC7702, ושם רואים שעיבוד פרומפט מהיר יותר בפורמטים מותאמים כמו Q4_K_M או Q4_0 עם repacking, אבל בדחיסות אגרסיביות יש פגיעה מסוימת בקצב ייצור הטקסט. הגרסאות המומלצות כאן מאזנות בין שמירה על המשקלים לבין חיסכון במקום.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון ההקשר הרחב מאפשר לקרוא קבצי טקסט שלמים, כל עוד יש לכם מספיק זיכרון להחזיק את המטמון.

  • סוכן מקומי ב־LM Studio

    גרסת Q4_K_M נכנסת בקלות לכרטיס של 12 או 16 גיגה בייט ומאפשרת שיחה מהירה בלי לשלוח מידע החוצה.

  • פיתוח על מעבדי ARM

    קבצי IQ4_NL ו־Q4_0 מנצלים את מנגנון ה־repacking המובנה כדי לשפר מהירות על חומרת מעבד.

איפה זה נופל

הכרטיס מודה בגלוי שגרסאות הדחיסה הנמוכות, כמו Q3_K_S או משפחת ה־IQ2, מספקות איכות נמוכה עד נמוכה מאוד, כך שאינן מתאימות למשימות שדורשות דיוק עובדתי. בנוסף, קבצי IQ אינם תואמים להרצה תחת Vulkan, מה שמגביל משתמשי AMD מסוימים. מעבר לכך, המודל מוגדר רשמית לאנגלית בלבד, ולכן צריך לבדוק היטב את איכות הפלט בעברית לפני שבונים עליו לשימוש מקומי.

אותה משפחה

Qwen2.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב המשתמשים, גרסת Q4_K_M במשקל 8.99 גיגה בייט היא נקודת האיזון הנכונה בין שמירה על יכולות המודל לנפח סביר. אם יש לכם כרטיס עם 16 גיגה בייט זיכרון ומעלה, לכו על Q6_K ששוקלת 12.12 גיגה בייט לקבלת איכות קרובה מאוד למקור.

האם הוא באמת יכול לעבד מיליון טוקנים על מחשב אישי?

המשקלים עצמם ייכנסו לזיכרון בגרסאות המכווצות, אבל החזקת הקשר מלא של מיליון טוקנים דורשת עשרות גיגה בייטים נוספים של זיכרון עבודה עבור ה־KV cache. בפועל, על מחשב ביתי ממוצע תוכלו לנצל רק עשרות אלפי טוקנים בודדים לפני שייגמר הזיכרון.

איך מריצים

כדי להריץ אותו מקומית צריך את llama.cpp או תוכנה כמו LM Studio שתומכת בפורמט GGUF. גרסת ברירת המחדל המומלצת היא Q4_K_M ששוקלת 8.99 גיגה בייט, ודורשת כרטיס מסך עם לפחות 12 גיגה בייט זיכרון כדי לטעון הכל לתוכו יחד עם זיכרון הקשר בסיסי. גרסאות קלות כמו IQ2_XS דורשות רק 4.70 גיגה בייט וירוצו על זיכרון מערכת רגיל, אבל באיכות נמוכה.

אם אתם מתכננים לנצל את מלוא חלון ההקשר של מיליון טוקנים, הזיכרון שנדרש למטמון ה־KV יחנוק כמעט כל כרטיס ביתי. במקרה כזה, עדיף לפנות ל־API חיצוני במקום לנסות להחזיק הקשר ענק מקומית.

ollama run hf.co/bartowski/Qwen2.5-14B-Instruct-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המשקלים והפצה של המודל בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗