GPT
K

Kimi-K2-Instruct-GGUF

קוד פתוח

unslothother2025-07-12

  • transformers
  • gguf
  • deepseek_v3
  • text-generation
  • unsloth

גרסת GGUF מכווצת של ענק ה־MoE הסיני עם טריליון פרמטרים, שבנוי לסוכנים אוטונומיים וכתיבת קוד. מיועד למי שרוצה ביצועי קצה בלי לשלוח מידע לשרתים חיצוניים.

  • 131,072טוקנים בהקשר
  • 15.3 TBמשקל הקבצים
  • 46,424הורדות בחודש
  • 229לייקים

מה זה

מדובר במודל Mixture of Experts עצום מבית Moonshot AI שמכיל טריליון פרמטרים, אבל מפעיל רק 32 מיליארד בכל טוקן דרך שמונה מומחים במקביל. ההתמחות המרכזית שלו היא פעולות מורכבות של סוכנים, הפעלת כלים ופתרון בעיות תכנות בלי צורך בחשיבה ארוכה מקדימה.

במבחני ביצועים הוא עוקף מודלים מובילים בכתיבת קוד עצמאית. הוא הגיע ל־65.8 אחוז בהרצה בודדת ב־SWE-bench Verified עם כלי טרמינל, ציון שמציב אותו מעל חלופות קוד פתוח מוכרות וקרוב מאוד למודלים סגורים מובילים. גם במשימות מתמטיקה וקריאות לכלים חיצוניים כמו Tau2 הוא מציג דיוק מרשים ביחס למודלים מקבילים.

מתאים ל

  • סוכן אוטונומי לתיקון באגים

    הצטיין ב־SWE-bench Verified בפתרון בעיות קוד מעשיות באמצעות גישה ישירה לעורכי טקסט ולטרמינל.

  • הפעלת כלים ו־API בארגון

    מציג אחוזי הצלחה גבוהים במבחני AceBench ו־Tau2 בבחירה נכונה והרצה של פונקציות חיצוניות.

  • פתרון בעיות מתמטיות קשות

    קיבל 97.4 אחוז במבחן MATH-500, מה שהופך אותו לבחירה מעולה לחישובים והוכחות מדויקות.

איפה זה נופל

למרות הגודל המפלצתי, במבחן Humanity's Last Exam המודל קיבל ציון נמוך של 4.7 אחוז בלבד, מה שמראה קושי אמיתי בידע מדעי מורכב ויוצא דופן. בנוסף, מדובר במודל רפלקסיבי ללא מנגנון חשיבה ארוך, כך שטעויות לוגיות עמוקות עלולות לצוץ מיד. הכרטיס מציין תקלות קודמות בטוקנייזר ובתבנית הצ'אט של קריאות לכלים, ואין במקור שום נתון על ביצועים או תמיכה בשפה העברית.

אותה משפחה

Kimi-K2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על מחשב נייד חזק?

לא. המודל דורש לפחות 128 גיגה זיכרון מאוחד רק כדי להעלות את הגרסאות המכווצות ביותר. גם עם שילוב של כרטיס מסך עם 16 גיגה ו־256 גיגה RAM הקצב איטי מאוד ומגיע לכ־5 טוקנים לשנייה.

איך כדאי להגדיר את הפרמטרים של המודל בריצה?

ההמלצה הרשמית של המפתחים היא לקבוע את הטמפרטורה על 0.6. ערך זה עוזר למנוע חזרתיות בטקסט ושומר על קוהרנטיות של התשובות בזמן עבודה שוטפת.

איך מריצים

כדי להריץ אותו משתמשים בגרסה העדכנית של llama.cpp או במנועים כמו vLLM ו־SGLang. הדרישות המינימליות לכימותים הקטנים מתחילות מ־128 גיגה זיכרון מאוחד. עם 16 גיגה VRAM ועוד 256 גיגה זיכרון RAM רגיל, המהירות תעמוד על כ־5 טוקנים לשנייה בלבד, ולתוצאות סבירות Unsloth ממליצים על גרסת 2bit XL לפחות. מומלץ לקבע את הטמפרטורה על 0.6 כדי למנוע חזרתיות.

המשקל המלא של כלל הקבצים מגיע ל־15.3 טרהבייט. אם אין ברשותכם שרת ייעודי כבד במיוחד, עדיף להשתמש ב־API התואם לפורמט של OpenAI ש־Moonshot מעמידה, במקום להיאבק בהרצה מקומית אטית מדי.

ollama run hf.co/unsloth/Kimi-K2-Instruct-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

368 קבצים במאגר, 15.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־Modified MIT לפי מאגר הגיטהאב של הפרויקט, אך מסומן כ־other ברישום. מומלץ לבדוק היטב את תנאי השינוי בקובץ הרישיון המקורי לפני שילוב שלו במוצר מסחרי או הפצה ללקוחות.

הרישיון המלא בעמוד המודל ↗