GPT
K

K2-Horizon-MoVA-36B-A4B-GGUF

קוד פתוח

IFMapache-2.02026-09-03

  • transformers
  • gguf
  • k2-horizon
  • 36b
  • mova

מודל מומחים שמחזיק 36 מיליארד פרמטרים אבל מפעיל רק 4 מיליארד לכל טוקן. הוא נותן חלון הקשר ענק של חצי מיליון טוקנים וביצועים מעולים בסוכנים ובקידוד.

  • 69.8 GBמשקל הקבצים
  • 4,590הורדות בחודש
  • 91לייקים

מה זה

מדובר בארכיטקטורת Mixture of Experts עם מנגנון Mixture of Values attention שפותחה על ידי IFM. הרעיון פה הוא חיסכון חישובי בזמן הסקה. אתם טוענים מודל גדול, אבל החישוב בפועל פר טוקן שווה ערך למודל קטן של 4 מיליארד פרמטרים. בנוסף, חלון ההקשר המקורי מגיע ל־524,288 טוקנים, מה שמאפשר להזין תיעוד טכני נרחב או בסיס קוד שלם.

במבחני ביצועים הוא בולט בעיקר בשימוש בכלים ומשימות סוכנים, עם ציון של 26.8 במבחן tau3 לעומת מודלים גדולים בהרבה כמו Nemotron 3 Ultra שקיבל 14.2. בסביבת מסוף הוא מגיע ל־58.6 במבחן Terminal Bench, שזה הציון הגבוה בטבלה. מנגד, בהסקה פיזיקלית עמוקה הוא נעצר ב־2.1 נקודות בלבד במבחן CritPt.

מתאים ל

  • סוכני פיתוח ומסוף

    הוא השיג 58.6 במבחן Terminal Bench ועוקף מודלים של עשרות ומאות מיליארדי פרמטרים בהרצת פקודות.

  • קריאה לפונקציות וכלים

    תוצאה של 26.8 במבחן tau3 Banking מראה התנהלות אמינה בבחירת כלים וניהול שיחה מרובת שלבים.

  • עיבוד מסמכים ארוכים

    חלון הקשר מקורי של 512K מאפשר לנתח תיקיות קוד שלמות או ספרים בלי לחתוך את הטקסט.

איפה זה נופל

הדיוק העובדתי שלו נמוך. במבחן AA Omniscience הוא הגיע ל־18.8 אחוז בלבד, מה שאומר שבשאלות ידע כללי שדורשות שליפה ישירה מהזיכרון הוא נוטה לטעות או להמציא פרטים. הוא תומך רשמית באנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד מסמכים בעברית. חיסרון נוסף הוא הצורך בהגדרות מיוחדות של פירוק פלט מחשבה וקריאות לכלים כדי לקבל תוצאות טובות, בלי אלו הביצועים עלולים לצנוח.

אותה משפחה

K2-Horizon-MoVA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה ישירות בגרסה הרשמית של llama.cpp?

לא כרגע. הארכיטקטורה של K2 Horizon דורשת התאמות שעדיין נמצאות בתהליך מיזוג. כרגע צריך להשתמש בגרסת הפורק של צוות MBZUAI-IFM כדי לטעון את קובצי ה־GGUF.

האם המודל מתאים לעבודה בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. מודלים שלא אומנו על עברית מייצרים פלט משובש או מתרגמים בצורה עילגת, ולכן למשימות מקומיות עדיף לבחור חלופה אחרת.

איך מריצים

הגרסה הזו מגיעה בפורמט GGUF ברמת דיוק מקורית של BF16 ומחולקת לחמישה קבצים במשקל כולל של 69.8 גיגה בייט. בשביל להחזיק משקל כזה בזיכרון צריך לפחות 80 גיגה בייט של VRAM או זיכרון אחוד, ולכן שרת של שני כרטיסי H200 או תחנת עבודה חזקה במיוחד הם דרישת בסיס. תמיכה רשמית בגרסה הרגילה של llama.cpp עדיין בעבודה, כך שצריך להשתמש בפורק ייעודי של MBZUAI או להרים שרת עם vLLM ו־SGLang.

אם אין לכם תשתית מקומית מתאימה או שאתם רק רוצים לבדוק תרחיש נקודתי, עדיף לחבר שרת ענן לפי שעה או לצרוך מודל דרך ממשק קיים במקום להוריד 70 גיגה בייט ולהסתבך עם קומפילציה של גרסאות מותאמות.

ollama run hf.co/IFM/K2-Horizon-MoVA-36B-A4B-GGUF:BF16

הקבצים

5 קבצים במאגר, 69.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של תוצרים, כולל הטמעה במוצרים סגורים. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים המקורית ולציין שינויים שבוצעו בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗