GPT
K

K2-Horizon-7B

קוד פתוח

IFMapache-2.02026-09-01

  • transformers
  • safetensors
  • k2_horizon
  • text-generation
  • k2-horizon

מודל פתוח לגמרי של 9 מיליארד פרמטרים שמתמחה בהסקה עמוקה ובסוכנים. חלון ההקשר העצום שלו, 512K טוקנים, מאפשר לנתח מסמכי ענק ופרויקטי קוד מלאים.

  • 9Bפרמטרים
  • 524,288טוקנים בהקשר
  • 16.8 GBמשקל הקבצים
  • 2,989הורדות בחודש

מה זה

המודל כולל כמעט 9 מיליארד פרמטרים ומגיע כמשקל דחוס עם ארכיטקטורת causal LM משלו ב־36 שכבות. החוזק שלו הוא ביכולות הסקה ארוכות, קוד ושימוש בכלים, כשהוא מציג חלון הקשר של 524,288 טוקנים מובנה מתהליך האימון. יוצרי המודל שחררו לא רק את המשקלים, אלא גם את נתוני האימון, הקוד והמתכון המלא.

במבחני ביצועים מול דגמים מקבילים כמו Qwen3.5 בגודל 9B או Gemma 4 ב־12B, הוא רושם פערים משמעותיים. במבחן SWE-bench Verified להנדסת תוכנה הוא הגיע ל־70.6% לעומת 50.8% של המתחרה הקרוב, ובמשימות טרמינל ושימוש בכלים בנקאיים הוא עקף מתחרים גדולים ממנו. עם זאת, התוצאות האלה נשענות על מצב חשיבה גבוה שמייצר פלט ארוך במיוחד.

מתאים ל

  • פתרון באגים במאגרי קוד

    התוצאה של 70.6% במבחן SWE-bench הופכת אותו למתאים במיוחד לבדיקה ותיקון שגיאות תוכנה אוטומטיות.

  • סוכנים מבוססי טרמינל

    יכולת השימוש בכלים ופקודות טרמינל מאפשרת לו לבצע אוטומציות מורכבות בסביבות עבודה טכניות.

  • עיבוד מסמכים עצומים

    חלון הקשר של חצי מיליון טוקנים מאפשר להזין תיעוד טכני מלא או כמה ספרים יחד בלי לקטוע את המידע.

איפה זה נופל

הכרטיס מדגיש שהתוצאות הגבוהות תקפות רק כאשר מגדירים reasoning effort על high, מה שדורש להקצות לפחות 32,768 טוקנים לפלט כדי שהתשובה לא תיקטע באמצע. המודל מוגדר רשמית לאנגלית בלבד, כך שאינו מתאים לעבודה בעברית ללא בדיקה יסודית. בנוסף, הארכיטקטורה שלו דורשת trust remote code, מה שמחייב זהירות באבטחת מידע, ומבחן הגלישה שלו נבדק תחת פרוטוקול חיתוך הקשר מסוים שלא בהכרח תואם לתנאים שלכם.

אותה משפחה

K2-Horizon יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. אם תפנו אליו בעברית ייתכן שהוא יענה, אבל איכות ההסקה, התחביר והדיוק לא נבדקו וסביר שיהיו נמוכים מאוד.

האם אפשר להריץ אותו בלי מצב חשיבה ארוך?

אפשר להוריד את רמת ההסקה לבינונית או נמוכה כדי לקבל תשובות מהירות, אך המפתחים מזהירים שהדבר פוגע בדיוק בצורה ניכרת. קיטוע של שרשרת המחשבה נחשב ככישלון של התשובה.

איזו חומרה מינימלית נדרשת להרצה?

כרטיס מסך בודד עם 24GB VRAM מספיק לטעינת המשקלים ולהקשרים קצרים. כדי לנצל את מלוא ההקשר של 512K טוקנים ופלט חשיבה מקסימלי, תצטרכו חומרה חזקה בהרבה.

איך מריצים

כדי להריץ אותו ב־bfloat16 מקומי תצטרכו לפחות 24GB זיכרון כרטיס מסך כדי להחזיק את 16.8GB המשקלים יחד עם זיכרון עבודה בסיסי. מנועי הסקה כמו vLLM או SGLang מריצים אותו על גבי GPU בודד עם הגדרת TP=1, אך דורשים אישור קוד מרוחק בגלל הארכיטקטורה הייעודית.

אם אתם מתכננים לנצל את כל חצי מיליון הטוקנים של חלון ההקשר או לייצר פלטים של 32,768 טוקנים לחשיבה, הזיכרון הנדרש יקפוץ דרמטית ותצטרכו כרטיסים מקצועיים כמו H200. במקרים שאין ברשותכם חומרה כזו, שירות ענן או API מנוהל יהיו זולים ופשוטים יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="IFM/K2-Horizon-7B")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 16.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש של המערכת בתוך מוצר סגור או פתוח. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗