GPT
K

Kimi-K3-GGUF

קוד פתוח

unslothother2026-07-27

  • transformers
  • gguf
  • unsloth
  • conversational
  • image-text-to-text

גרסת GGUF למודל ענק עם 2.8 טריליון פרמטרים שפותח למשימות פיתוח תוכנה מורכבות וסוכנים עצמאיים. הוא נועד למי שרוצה ביצועים ברמה עולמית בקוד פתוח ותמיכה בחלון הקשר של מיליון טוקנים.

  • 6.7 TBמשקל הקבצים
  • 485,433הורדות בחודש
  • 379לייקים

מה זה

מדובר במודל מולטימודלי פתוח משקלים עם ארכיטקטורת תערובת מומחים שמפעילה רק 104 מיליארד פרמטרים מתוך 2.8 טריליון עבור כל טוקן, דרך 16 מומחים פעילים מתוך 896. החומרה הפנימית שלו נשענת על מנגנון קשב משולב ותמיכה מובנית בתמונה וטקסט באמצעות מקודד ויזואלי של 401 מיליון פרמטרים.

התוצאות במבחנים מראות שהוא מתחרה ישירות בדגמים המובילים בשוק. במבחן SWE-Marathon שמודד תכנות מורכב לאורך זמן הוא מוביל עם 42.0 מול 35.0 של קלוד, וב־MCPMark-Verified שמודד חיבור לכלים חיצוניים הוא מגיע ל־94.5 לעומת 87.4. עם זאת, במבחני תכנון ארוך טווח כמו CritPt הוא משיג 23.4 ונשאר מאחור.

מתאים ל

  • פיתוח תוכנה ארוך טווח

    ניווט במאגרי קוד ענקיים והרצת כלי טרמינל, שבהם הוא עוקף מודלים סגורים עם ציון של 42.0 במבחן SWE-Marathon.

  • סוכני רשת ואוטומציה

    הפעלת כלים וקריאות מערכת דרך פרוטוקול MCP, שם הוא מציג דיוק של 94.5 במבחן MCPMark-Verified.

  • ניתוח מסמכים ותמונות

    עיבוד משולב של תמונות וטקסט על פני חלון הקשר של מיליון טוקנים באמצעות מקודד MoonViT-V2 ייעודי.

איפה זה נופל

החולשה העיקרית שלו נחשפת במבחני חשיבה קיצוניים. במבחן CritPt הוא הגיע ל־23.4 בלבד, פער משמעותי מול 32.3 של GPT-5.6 Sol ו־28.6 של קלוד. במבחן HLE-Full הוא משיג 43.5, ציון נמוך בהשוואה ל־53.3 של Claude Fable 5. לפני שמטמיעים אותו בתהליכים קריטיים, חשוב לבדוק את היציבות שלו בניתוח לוגי עמוק ומחקר מופשט.

אותה משפחה

Kimi-K3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על שרת מקומי בודד?

לא. משקל הקבצים הכולל הוא 6.7 טרה בייט, והמודל מכיל 2.8 טריליון פרמטרים. כדי להריץ אפילו גרסה מכווצת שלו נדרשת תשתית שרתים מרובת כרטיסי מסך עם נפח זיכרון חריג.

במה המודל הזה שונה מגרסאות MoE קודמות?

הוא מפעיל רק 104 מיליארד פרמטרים מתוך 2.8 טריליון בכל רגע נתון, באמצעות 16 מומחים פעילים מתוך 896. החלוקה הזו משפרת את יעילות הריצה פי 2.5 בהשוואה לדור הקודם.

איך מריצים

בשביל להריץ את המודל צריך להשתמש בפיצול ייעודי של llama.cpp לפי בקשת המשיכה שהם פרסמו, או דרך Unsloth Studio. הכרטיס מציג גרסאות מכווצות כמו UD-Q4_K_XL או גרסת UD-Q8_K_XL שנחשבת לדיוק מלא ללא איבוד מידע, ושוקלת 50 גיגה בייט יותר מגרסת Q4.

המשקל הכולל של הקבצים מגיע ל־6.7 טרה בייט על פני 171 קבצים. זו מפלצת חומרה שדורשת אשכול שרתים ייעודי עם נפח זיכרון עצום, ולא משהו שמריצים על תחנת עבודה יחידה במשרד.

ollama run hf.co/unsloth/Kimi-K3-GGUF:IQ1_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

171 קבצים במאגר, 6.7 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים מופצים תחת רישיון שמוגדר כ־other בכרטיס המודל ונקרא Kimi K3 License. המסמך מציין שהמשקלים פתוחים למחקר, פיתוח וחדשנות, אבל תנאי השימוש המסחריים הספציפיים והמגבלות המשפטיות לא פורטו במלואם בטקסט עצמו. חובה לקרוא את קובץ הרישיון המקורי לפני שילוב שלו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗