GPT

מודלים ותשתית · קוד פתוח

הלוגו של K/V Cache Quantization

K/V Cache Quantization

טכניקת כימות זיכרון המפתח ערך מאפשרת לצמצם את נפח הזיכרון הגרפי שנדרש להחזקת הקשר השיחה במודלי שפה פתוחים. במקום להסתפק בהגדרת ברירת המחדל הבזבזנית, השיטה מנמיכה את הדיוק הנומרי של היסטוריית הטקסט בזמן אמת.

החידוש המרכזי בשילוב השיטה בתוך אולמה הוא היכולת להריץ חלונות הקשר גדולים משמעותית או מודלים כבדים יותר על אותה חומרה קיימת. הפתרון מתמקד ישירות בצוואר הבקבוק של זיכרון ההקשר ולא במשקלי המודל עצמם.

  • מודלים ותשתית
  • קוד פתוח
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
קוד פתוח
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
smcleod.net
נבדק
2026-09-08

הסקירה

כשמפעילים את Ollama עם משתנה הסביבה המתאים, מנגנון ה-K/V Cache Quantization דוחס את זיכרון ההקשר הפעיל של המודל בזמן אמת. במקום לשמור את כל המידע של השיחה ברמת דיוק רגילה של F16 שתופסת המון מקום, הוא מוריד את הדיוק לערכים כמו Q8_0 או Q4_0. התוצאה הישירה היא צריכת זיכרון גרפי נמוכה בהרבה, מה שמשחרר מקום יקר בכרטיס המסך שלכם. זה לא דורש שרתים מיוחדים או תשלום על רישיונות ענן.

ההבדל העיקרי מול דחיסת מודלים רגילה הוא שכאן המשקולות של המודל נשארות בדיוק כפי שהורדתם אותן. הדחיסה פועלת אך ורק על הזיכרון שנוצר תוך כדי הריצה והשיחה. שימוש ב-Q8_0 חותך בחצי את צריכת ה-VRAM עבור ההקשר עם פגיעה מינימלית באיכות התוצרים. במודל של 8B עם חלון הקשר של 32K טוקנים, זיכרון ההקשר המקורי דורש כ-6GB, אך תחת Q8_0 הוא יורד לכ-3GB בלבד. במצב Q4_0 הצריכה צונחת לכ-2GB, כלומר חיסכון של כ-66% מהזיכרון.

שליטה והגדרות בקובצי סביבה

החיסכון הזה מאפשר לכם לקחת מודל קיים ולהכפיל לו את חלון ההקשר, למשל מ-32K ל-64K טוקנים בלי לקרוס. אפשרות אחרת היא להריץ מודל עם פרמטרים כבדים יותר, כמו מעבר ממודל של 8B למודל של 14B על אותו מחשב. משימות כתיבת קוד נהנות במיוחד מהרחבת ההקשר הזו, כי קבצי תוכנה ארוכים דורשים זיכרון עבודה גדול. הפגיעה בביצועי המהירות כמעט בלתי מורגשת, כי דחיסת מפתח משפרת מעט את הקצב ודחיסת ערך מאיטה מעט.

זה פשוט עובד על חומרה מקומית.

מה שבאמת מפריע כאן הוא חוסר הגמישות המוחלט של המימוש הנוכחי. אי אפשר להגדיר את רמת הדחיסה בתוך קובץ Modelfile של מודל ספציפי, ואי אפשר לדרוש אותה דרך ה-API של Ollama או משורת הפקודה. אתם מחויבים לקבוע את הדחיסה כמשתנה סביבה גלובלי לכל השרת, כך שכל המודלים באותו תהליך יקבלו את אותה הגדרה בדיוק. בנוסף, חובה להפעיל Flash Attention ידנית באמצעות משתנה ייעודי כדי שהעסק יפעל.

הפעלת הדחיסה במערכת

  1. 01הורדת גרסה עדכנית
  2. 02הפעלת Flash Attention
  3. 03הגדרת משתנה סביבה
  4. 04הפעלת שרת מחדש

התאמה למשימות ומחיר הקוד

הפתרון הזה פתוח וחופשי לשימוש לחלוטין במסגרת קוד פתוח, בלי מדרגות תשלום ובלי מסלולים בתשלום חודשי. אין מחירון ואין גרסת פרו, כך שכל הכלים מגיעים ישר ממאגר הקוד של הפרויקט. ההוצאה הכספית היחידה שלכם היא החומרה המקומית והחשמל שכרטיס המסך שלכם צורך בפועל. למי שמריץ מודלים במחשב האישי בלי תקציב לשרתים, הגישה הזו חוסכת שדרוגי חומרה יקרים שנמדדים באלפי שקלים.

לא הייתי משתמש בזה למשימות שדורשות דיוק מתמטי עדין כשעובדים ברמת Q4_0. הרמה הזו מציגה ירידה מורגשת באיכות הפלט, ולכן היא שווה את זה רק אם אין לכם שום ברירה אחרת והזיכרון בכרטיס נגמר לחלוטין. עבור רוב השימושים היומיומיים, מעבר ל-Q8_0 מספק שיווי משקל מצוין בין חיסכון במקום לשמירה על חדות המודל. אם מתעוררות בעיות באיכות המענה, מבטלים את המשתנה וחוזרים ל-F16 המקורי.

המגבלות הטכניות מחייבות בדיקה קפדנית.

הטקסט של הכלי ושל הפרויקט כולו נכתב באנגלית, וכל התיעוד והדיונים הטכניים מתנהלים בשפה זו בלבד. אין כאן התייחסות ספציפית לעברית, אבל מכיוון שמדובר במנגנון זיכרון פנימי, השפה שבה המודל מייצר טקסט לא משנה את אופן הדחיסה עצמו. אם המודל הבסיסי שבו אתם משתמשים מתפקד היטב בעברית, צמצום זיכרון ההקשר ישמור על אותן תכונות בלי לייצר בעיות ייחודיות לשפה.

הכלי מיועד בעיקר למפתחים שכבר מריצים שרת Ollama ומבינים איך לערוך משתני סביבה במערכת ההפעלה או בתוך קונטיינרים. מי שמחפש ממשק כפתורים פשוט בלי להתעסק עם קונפיגורציה ימצא את התהליך מסורבל. אם אתם מחזיקים כרטיס מסך עם נפח קטן ומנסים להריץ מודלים מודרניים על טקסטים ארוכים, הכלי הזה יפתור לכם את בעיית הזיכרון בלי להוציא שקל נוסף.

  • רישיון שימושקוד פתוח
  • שליטה דרך APIלא נתמכת כרגע
  • שפת תיעודאנגלית בלבד

מה K/V Cache Quantization
עושה

התהליך מתבצע על ידי קידוד מחדש של ערכי המפתח והערך של המודל לרמות דיוק נמוכות יותר כמו שמונה או ארבע סיביות במקום שש עשרה סיביות. הפחתת הדיוק לרמת שמונה סיביות חותכת את צריכת הזיכרון של ההקשר בחצי, בעוד שמעבר לארבע סיביות מוריד כשני שלישים מנפח הזיכרון הנדרש.

הפעלת התכונה מתבצעת ברמת תהליך ההרצה על ידי הגדרת משתני סביבה מתאימים והפעלת פלאש אטנשן לפני עליית המערכת. במודל עם שמונה מיליארד פרמטרים וחלון הקשר של שלושים ושניים אלף טוקנים, החיסכון מפחית את הדרישה משישה גיגה בייט לכשלושה גיגה בייט בלבד.

כמה זה
עולה

מדובר בפיתוח קוד פתוח שהוטמע ישירות לתוך הפרויקט של אולמה, ולכן הוא זמין לשימוש חופשי ללא עלות כספית או רכישת רישיונות. החיסכון היחיד כאן מתבטא במניעת הוצאות על כרטיסי מסך חזקים או שדרוגי חומרה יקרים יותר לצורך הרחבת הזיכרון.

קוד פתוח

המספרים נקראו מעמוד התמחור של K/V Cache Quantization ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

מתאים למי שמריץ מודלים באופן מקומי במחשב האישי או בשרת עצמאי ונתקל במגבלות זיכרון גרפי. זה רלוונטי בעיקר למי שעובד על משימות פיתוח קוד או ניתוח מסמכים ארוכים שדורשים חלונות הקשר רחבים במיוחד.

מי שמשתמש במודלים דרך ממשקי ענן מסחריים כמו אופן איי איי או שאינו מריץ מודלים בקוד פתוח על חומרה משלו לא צריך את זה. ההגדרה גם מיותרת למי שמריץ פרומפטים קצרים בלבד שאינם ממלאים את הזיכרון הקיים.

מה לבדוק
לפני שמתחייבים

לפני שמפעילים את הדחיסה, כדאי לדעת שההגדרה נקבעת ברמת השרת כולו ולא ניתנת לשליטה דינמית דרך הפיקוד הישיר של המודל או בקשות קריאה חיצוניות. בנוסף, חובה לוודא שהחומרה תומכת בפלאש אטנשן כדי שהמנגנון יעבוד.

רמת דחיסה של ארבע סיביות גוררת ירידה מורגשת באיכות הפלט של המודל. מומלץ לבדוק ביצועים עם שמונה סיביות לפני שמנסים רמות קיצוניות יותר.

מה K/V Cache Quantization
פרסמו בקוד פתוח

K/V Cache Quantization מפרסמים גם מודלים פתוחים שאפשר להוריד ולהריץ. אלה הגדולים שבהם לפי מספר ההורדות ב־Hugging Face.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על K/V Cache Quantization כאן. אם השתמשתם בK/V Cache Quantization, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה K/V Cache Quantization
אומר על עצמו

K/V context cache quantisation has been added to Ollama. This enables significant reductions in VRAM usage, allowing users to realise the potential of expanded context sizes and run larger models at their existing context sizes.

מהאתר של K/V Cache Quantization, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם הכימות של ההקשר משפיע על מהירות יצירת הטקסט?

ההשפעה על מהירות הביצועים זניחה למדי. כימות הזיכרון עשוי לשפר מעט חלק מפעולות החישוב ולפגוע במעט באחרות, אך בפועל קצב יצירת המילים נשאר כמעט זהה לחלוטין.

האם אפשר להגדיר דרגות דחיסה שונות למודלים שונים באותו שרת?

לא באופן מובנה מתוך פקודת ההרצה של המודל. כדי לעבוד עם תצורות שונות במקביל צריך להריץ מופעים נפרדים של השרת במכולות שונות עם משתני סביבה ייעודיים לכל אחד.

מה K/V Cache Quantization עושה?

טכניקת כימות זיכרון המפתח ערך מאפשרת לצמצם את נפח הזיכרון הגרפי שנדרש להחזקת הקשר השיחה במודלי שפה פתוחים. במקום להסתפק בהגדרת ברירת המחדל הבזבזנית, השיטה מנמיכה את הדיוק הנומרי של היסטוריית הטקסט בזמן אמת. החידוש המרכזי בשילוב השיטה בתוך אולמה הוא היכולת להריץ חלונות הקשר גדולים משמעותית או מודלים כבדים יותר על אותה חומרה קיימת. הפתרון מתמקד ישירות בצוואר הבקבוק של זיכרון ההקשר ולא במשקלי המודל עצמם.

האם K/V Cache Quantization חינמי?

לפי מה שהאתר של K/V Cache Quantization מפרסם, קוד פתוח. תנאים משתנים. כדאי לאמת מול עמוד התמחור שלו.

האם K/V Cache Quantization תומך בעברית?

האתר של K/V Cache Quantization מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־K/V Cache Quantization?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • הלוגו של Keywords AI בתשלום

    Keywords AI

    ניתוב קריאות למודלי שפה, שמירת מטמון, מעקב עלויות ובדיקות איכות בנקודת קצה אחת.

    מודלים ותשתית keywordsai.co
  • הלוגו של kimi-k2.6 קוד פתוח

    kimi-k2.6

    מודל שפה לעיבוד טקסט ותמונות עם חלון הקשר של 256 אלף טוקנים וכלי עזר מוכנים.

    מודלים ותשתית platform.kimi.ai
  • הלוגו של Kinestex לא צוין

    Kinestex

    מעקב תנועה מבוסס בינה מלאכותית דרך מצלמת המכשיר להטמעה באפליקציות כושר ובריאות.

    מודלים ותשתית kinestex.com
  • הלוגו של LAION לא צוין

    LAION

    גישה למאגרי ענק פתוחים של קישורים לתמונות וטקסטים לאימון מודלים של בינה מלאכותית.

    מודלים ותשתית laion.ai
  • L לא צוין

    Learning from Data (by Yaser S. Abu-Mostafa, Caltech)

    קורס אקדמי מקוון שמלמד את יסודות התיאוריה והאלגוריתמים של למידת מכונה.

    מודלים ותשתית work.caltech.edu
  • הלוגו של LLMEval קוד פתוח

    LLMEval

    הערכת מודלי שפה גדולים בעזרת מבחנים אקדמיים, משימות רפואיות ובדיקות לוגיות מורכבות.

    מודלים ותשתית llmeval.com