GPT
K

K2-Horizon-MoVA-36B-A4B

קוד פתוח

IFMapache-2.02026-09-01

  • transformers
  • safetensors
  • k2_horizon
  • text-generation
  • k2-horizon

מודל מומחים שמחזיק 36 מיליארד פרמטרים אך מפעיל רק 4 מיליארד בכל טוקן. הוא נותן ביצועי חשיבה וסוכנים חזקים בחצי מיליון טוקנים הקשר.

  • 37Bפרמטרים
  • 524,288טוקנים בהקשר
  • 69.8 GBמשקל הקבצים
  • 3,205הורדות בחודש

מה זה

מדובר במודל MoE עם ארכיטקטורת קשב MoVA, שמחזיק 37,444,792,020 פרמטרים בזיכרון ומריץ בפועל 4 מיליארד פרמטרים לטוקן. היכולת הזו מאפשרת לו לפעול במהירות חישובית של מודל קטן יחסית, תוך שמירה על קיבולת ידע של מודל בינוני.

במבחני סוכנים וקוד הוא מציג תוצאות מעניינות. במבחן השימוש בכלים tau3-Banking הוא מוביל עם תוצאה של 26.8 לעומת מתחרים במשקל כבד, ובמבחן הפעלת הטרמינל Terminal-Bench 2.1 הוא מגיע ל־58.6. מנגד, במשימות תכנות מדעי כמו SciCode הוא מגיע ל־38.9, תוצאה סבירה אך נמוכה מזו של Muse Glimmer-30B שמגיע ל־43.6.

הוא מאומן מראש לחלון הקשר ענקי של 524,288 טוקנים, ותומך בבחירת רמת מאמץ חשיבה פר קריאה, כאשר פלט החשיבה חוזר בשדה ייעודי לצד התשובה.

מתאים ל

  • סוכני אוטומציה וטרמינל

    מתאים להרצת פקודות מערכת וקריאות לכלים הודות לתוצאה של 58.6 בטרמינל ותמיכה מובנית בפענוח XML.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 512K טוקנים מאפשר לטעון פרויקטים שלמים וספריות קוד בלי צורך בחיתוך אגרסיבי.

  • פתרון בעיות בשלבים

    מנגנון חשיבה מובנה שמפריד בין שלבי ההיגיון לתשובה הסופית, עם שליטה בעומק המאמץ בכל קריאה.

איפה זה נופל

בדיוק עובדתי המודל מציג חולשה ברורה, עם 18.8 בלבד במבחן AA-Omniscience Accuracy, נמוך בהרבה ממתחרים דחוסים בגודל דומה. גם במבחן הפיזיקה המתקדמת CritPt הוא מגיע ל־2.1 בלבד. המודל מוגדר רשמית לשפה האנגלית בלבד, ואינו כולל נתונים או בדיקות בעברית. בנוסף, חלון ההקשר המלא דורש משאבי זיכרון קיצוניים, כך שבפקודות ההרצה עצמן המפתחים מגבילים את האורך ל־131,072 טוקנים כדי לא לקרוס.

אותה משפחה

K2-Horizon-MoVA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת עם כרטיס GPU בודד?

לא בגרסה הנוכחית של bfloat16 שתופסת קרוב ל־70 גיגה בייט. המפתחים ממליצים על מערך של שני מאיצים דוגמת H200 כדי לחלק את העומס בין הזיכרון והמומחים.

איך המודל מחזיר קריאות לכלים?

המודל תומך בפורמטים של JSON ו־XML, כאשר ברירת המחדל היא XML. בעת ההרצה בשרת יש להפעיל מפענח ייעודי בשם k2_horizon כדי לתרגם את הפלטים כראוי.

האם המודל מתאים ליישומים בעברית?

הכרטיס מצהיר על אנגלית בלבד ולא מציג מדדים לשפות נוספות. ללא בדיקה יזומה מול משימות בעברית, לא כדאי להסתמך עליו במוצר מקומי.

איך מריצים

המשקל הכולל של הקבצים עומד על 69.8 גיגה בייט, כך שאי אפשר להריץ אותו על חומרה צרכנית בודדת ללא קוונטיזציה. בשרתי הפצה דוגמת vLLM או SGLang, התיעוד מציג ריצה עם מקביליות טנזורים ומומחים על גבי שני כרטיסי H200 בפורמט bfloat16, תוך הפעלת trust-remote-code לארכיטקטורה החדשה.

אם אין לכם קלאסטר שרתים עם שני מאיצים חזקים ודי זיכרון VRAM להחזיק גם את המשקלים וגם הקשר ארוך, תתקשו להריץ אותו עצמאית בביצועים שמישים. במצב כזה עדיף לחכות שספקי ענן יציעו גישה מנוהלת אליו בממשק תואם OpenAI במקום לתחזק שרת ייעודי ויקר.

from transformers import pipeline

pipe = pipeline("text-generation", model="IFM/K2-Horizon-MoVA-36B-A4B")
print(pipe("שלום"))

הקבצים

63 קבצים במאגר, 69.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים פרטיים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗