GPT
Q

Qwen3.8-27B-i1-IQ4_KS_KT-GGUF

קוד פתוח

cHunter789apache-2.02026-08-14

  • gguf
  • image-text-to-text
  • qwen
  • ik_llama.cpp
  • nvidia

גרסת קוונטיזציה מיוחדת שנועדה לדחוס מודל של 27 מיליארד פרמטרים ישירות לתוך כרטיס מסך צרכני של 16GB. המטרה כאן היא להגיע להקשר ארוך בלי לגלוש לזיכרון המערכת.

  • 27.7 GBמשקל הקבצים
  • 16,727הורדות בחודש
  • 40לייקים

מה זה

הקובץ הזה מביא את Qwen3.8-27B לפורמט GGUF בעזרת שיטות הדחיסה KS ו־KT מתוך פרויקט ik_llama.cpp. המטרה המרכזית של מי שארז אותו הייתה פשוטה: לגרום למודל שלם של 27B לעבוד על כרטיס בודד של 16GB, בלי לחתוך את גודל ההקשר לערכים מגוחכים. כדי להרוויח איכות בלי לשלם בזיכרון גרפי, שכבת ה־token_emd הוגדלה ל־q8_0, כי ממילא היא נטענת ל־RAM של המחשב ולא לכרטיס המסך, מה שעוזר במיוחד בעיבוד שפות שאינן אנגלית.

המפרסם השווה את הקוונטיזציה שלו מול גרסת IQ4_XS של mradermacher על טקסט של מלחמה ושלום בהקשר של 65,536 טוקנים. במבחן הזה התקבל ציון Perplexity של 8.2890 לעומת 8.2955, כלומר שיפור מזערי ממש באיכות השפה, אבל במחיר של זמן טעינה ארוך פי שלושה וירידה קלה בקצב ה־prefill מ־1048 ל־1004 טוקנים לשנייה. בשורה התחתונה, ההבדל באיכות זניח, והרווח הוא היכולת להחזיק הקשר גדול ביציבות על חומרה זולה יחסית.

מתאים ל

  • ניתוח מסמכים ארוכים

    דחיסת ה־KV cache מאפשרת לפתוח חלון הקשר של מעל 100k טוקנים על כרטיס מסך בודד בלי לחרוג מהזיכרון.

  • פיתוח מקומי מבודד

    מתאים לעבודה תחנתית ללא תלות בענן או הוצאות שוטפות, בתנאי שיש כרטיס Nvidia תואם.

  • עיבוד טקסט רב-לשוני

    שכבת ה־embeddings נשמרה באיכות q8_0 כדי לשפר פענוח שפות שאינן אנגלית על גבי ה־RAM.

איפה זה נופל

הקובץ נשען על פיצ'רים של ik_llama.cpp ועל הגדרות דרייבר ייחודיות ל־Nvidia, כך שעל כרטיסי AMD או מעבדי Apple Silicon הוא לא יתנהג אותו הדבר. יתרה מזאת, שיפור האיכות שנמדד במבחני perplexity עומד על שבריר אחוז בודד, בעוד שזמן הטעינה הראשוני של המודל קפץ מ־2.5 שניות ל־9.3 שניות. ההרצה בהקשר של 110k מגרדת את תקרת הזיכרון של כרטיסי 16GB ומחייבת קוונטיזציה אגרסיבית ל־cache, מה שעלול לפגוע בדיוק של תשובות ארוכות.

שאלות
נפוצות

האם המודל יעבוד על כרטיס מסך שאינו של Nvidia?

לא לפי הגדרות המפרסם. הקובץ מותאם במפורש לארכיטקטורה של Nvidia ולתכונת Unified Memory של CUDA, כך שכרטיסים של יצרנים אחרים לא ייתנו את אותה התוצאה.

מה צריך להגדיר כדי לא לקבל שגיאות חריגת זיכרון בהקשר מקסימלי?

חובה להגדיר את משתנה הסביבה GGML_CUDA_ENABLE_UNIFIED_MEMORY לערך 1, להשתמש בדגלי q4_0 ל־cache של K ו־V, ולוודא בעזרת הסקריפט ctx-cliff.py שההקשר שלכם לא עובר את תקרת ה־110k טוקנים.

האם גרסת ה־IQ4_KT עדיפה על ה־IQ4_XS המקורית?

ההבדל מזערי מאוד. בדיקת Perplexity הראתה שיפור של פחות ממאית הנקודה באיכות הטקסט, אבל שילמתם על זה בירידה קלה במהירות ה־prefill ובטעינה ראשונית ארוכה יותר.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של Nvidia עם לפחות 16GB VRAM, כמו RTX 5070 Ti שנבדק בכרטיס המודל, וזיכרון מערכת מספק לשכבת ה־embeddings. חובה להגדיר את משתנה הסביבה GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 לפני ההפעלה, ולהשתמש בקוונטיזציה של q4_0 עבור ה־KV cache. בהגדרה של 105k טוקנים הקצב עומד על מעל 1300 טוקנים לשנייה ב־prefill, ויורד מ־45 ל־25 טוקנים לשנייה בשלב ה־decode ככל שההקשר מתמלא.

אם אין לכם כרטיס של Nvidia עם 16GB פנויים, או אם אתם צריכים לשרת עשרות משתמשים במקביל ולא בקשה אחת בכל פעם, עדיף לפנות ל־API ענן. ההרצה הזו מוגדרת למשתמש יחיד וסוחטת את החומרה עד הקצה.

ollama run hf.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF:IQ4_KT

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים ומציינים שינויים שנעשו. אפשר לשלב אותו במוצרים פנימיים או חיצוניים בלי דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗