GPT
K

Kimi-Linear-48B-A3B-Instruct-GGUF

קוד פתוח

ymckimit2025-12-18

  • transformers
  • gguf
  • pytorch
  • text-generation
  • en

גרסת GGUF ניסיונית למודל תערובת מומחים של מונשוט, שמציעה התאמה לכרטיסי מסך בודדים. הפרויקט פונה למי שרוצה לדחוף הקשרים ארוכים במיוחד על חומרה מקומית צנועה יחסית.

  • 147 GBמשקל הקבצים
  • 1,347הורדות בחודש
  • 37לייקים

מה זה

המאגר מכיל המרות קוונטיזציה של מודל Kimi Linear 48B A3B Instruct מבית Moonshot AI. המודל בנוי בארכיטקטורת תערובת מומחים עם מנגנון מומחים משותפים ודחיסת קשב מסוג MLA, שמחייבת שמירת זיכרון הקשר בדיוק F16. היוצר בנה קבצים ייעודיים עם מטריצת חשיבות שמבוססת על טקסטים באנגלית וביפנית כדי לשפר ביצועים בשפות האלה.

מבחני המבוכה מראים שהגרסאות המכווצות מצליחות להישאר קרובות למקור, שעומד על 7.291970 בבסיס. גרסאות Q5 ו־Q4 עם מטריצת חשיבות מציגות מבוכה של 7.11 ו־7.14 בהתאמה, וגרסת MXFP4 MOE ששוקלת 27.21 גיגה בייט שומרת על מבוכה נמוכה של 7.17. המשמעות בפועל היא שהאיכות הלשונית כמעט לא נפגעת במעבר לגרסאות ארבעה ביט.

מתאים ל

  • עיבוד מסמכים ארוכים

    מאפשר לנתח טקסטים של מאות אלפי טוקנים על כרטיס מסך בודד של 24 או 32 גיגה בייט.

  • משימות באנגלית ויפנית

    הקוונטיזציה נבנתה במיוחד עם מטריצת חשיבות משולבת ששומרת על דיוק התוכן בשפות האלה.

  • שרת מקומי דל משאבים

    תומך בטעינת חלק מהמומחים לכרטיס המסך והרצת שאר המודל על זיכרון המחשב והמעבד.

איפה זה נופל

זה פרויקט ניסיוני לחלוטין שמחייב קוד מפוצל ולא רשמי של llama.cpp, מה שאומר שאין עדכונים שוטפים או יציבות מובטחת. המודל מתועד לאנגלית וליפנית בלבד, כך שאין שום הבטחה או בדיקה לגבי עברית. בנוסף, גרסאות שני ביט כמו Q2_K מזניקות את המבוכה ל־8.29 ומעלה ופוגעות באיכות באופן מורגש, והיוצר לא יצר מטריצת חשיבות ייעודית לאנגלית בלבד.

שאלות
נפוצות

האם אפשר להשתמש בגרסה רגילה של llama.cpp?

לא. התמיכה בארכיטקטורה של המודל הזה דורשת להוריד ולקמפל ענף ספציפי ממאגר הגיטהאב של ymcki. אם תנסו להריץ אותו בכלים סטנדרטיים כמו Ollama או גרסאות רשמיות, הוא פשוט לא ייטען.

איזו גרסה מומלצת לכרטיס עם 24 גיגה בייט זיכרון?

גרסת IQ3_S ששוקלת 21.33 גיגה בייט תיתן לכם חלון הקשר של 112 אלף טוקנים עם פגיעה קטנה במבוכה. אם אתם חייבים הקשר קיצוני של 240 אלף טוקנים על כרטיס כזה, תצטרכו לרדת ל־IQ3_XXS, אבל האיכות תרד בהתאם.

איך מריצים

אי אפשר להריץ את הקבצים האלה עם בינארי רגיל של llama.cpp. צריך לשכפל ענף ייעודי ממאגר הגיטהאב של היוצר, לקמפל אותו מקומית עם תמיכת CUDA, ורק אז להריץ דרך שורת הפקודה.

מבחינת חומרה, כרטיס בודד של 32 גיגה בייט יריץ גרסת Q4_K_M עם הקשר של 128 אלף טוקנים, או גרסת MXFP4 עם 240 אלף טוקנים. אם יש לכם רק כרטיס של 24 גיגה בייט, תצטרכו לרדת לגרסאות IQ3 כדי לקבל הקשר ארוך, או לפצל את הריצה בעזרת הדגל שמוריד רק את המומחים המשותפים לכרטיס המסך ואת השאר למעבד ולזיכרון המחשב.

ollama run hf.co/ymcki/Kimi-Linear-48B-A3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ ברישיון MIT חופשי ומתירני. מותר להשתמש בקבצים למטרות מסחריות, לשנות אותם ולהפיץ אותם בתוך מוצר, בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗