GPT
K

K2-Horizon-0.9B

קוד פתוח

IFMapache-2.02026-09-01

  • transformers
  • safetensors
  • k2_horizon
  • text-generation
  • k2-horizon

מודל דחוס שמיועד להסקה לוגית, קוד ומתמטיקה עם חלון של 128 אלף טוקנים. הוא פונה למי שרוצה להריץ מודל חשיבה מקומי בלי לשלם בחומרה כבדה.

  • 1.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 5,883הורדות בחודש

מה זה

מדובר במודל שפותח באמצעות זיקוק ממספר מודלים שונים בתחומי מדע, קוד והוראות. למרות שהוא מכיל כמיליארד פרמטרים בלבד, הוא מציג יכולות הסקה מפתיעות למשקל שלו, במיוחד במבחני קוד ופתרון בעיות מתמטיות תחרותיות.

במדדי קוד כמו HumanEval פלוס ו־MBPP פלוס הוא עוקף אפילו מודלים בגודל כפול כמו Qwen3.5-2B, עם ציונים של 79.9 ו־68 בהתאמה. במתמטיקה תחרותית של AIME 2026 הוא מגיע ל־48.5 אחוז, מה שמציב אותו הרבה מעבר למקובל בקטגוריית הגודל שלו. ההבדל המרכזי כאן הוא התמקדות בשלבי חשיבה ארוכים במקום יצירת טקסט ישירה.

מתאים ל

  • פתרון בעיות תכנות מקומי

    עוקף מודלים כפולים ממנו בגודל במבחני HumanEval ומספק פתרונות מדויקים ישירות בסביבת הפיתוח.

  • עוזר מתמטי קל משקל

    משיג 48.5 אחוז ב־AIME 2026 ומאפשר הרצת תהליכי הסקה מורכבים על חומרה ביתית פשוטה.

  • ניתוח קבצי טקסט ארוכים

    תומך בחלון הקשר של 128K טוקנים לקריאת קוד ומסמכים ארוכים באנגלית בלי צורך לחתוך אותם.

איפה זה נופל

הנקודה החלשה ביותר היא הפעלת כלים וסוכנים, שבה הוא השיג רק 28 אחוז במבחן BFCL v4. גם שאלות מדעיות ברמת תואר שני מניבות 27.3 אחוז בלבד ב־GPQA Diamond, שזה חצי מביצועי מודל 2B. בנוסף, חובה להקצות לפחות 32,768 טוקנים לפלט, משום שקיטוע של החשיבה מוביל לתשובה שגויה לגמרי. המודל גם אומן על אנגלית וסינית בלבד, כך שעברית לא נתמכת באופן רשמי.

אותה משפחה

K2-Horizon יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא עשוי להבין מילים בודדות בעברית, אך תהליך ההסקה והפלט יישברו במהירות.

למה חובה להגדיר אורך פלט של 32K טוקנים?

המודל בנוי לחשוב לעומק לפני שהוא עונה. חיתוך הפלט באמצע שלב ההסקה פוסל את התשובה כולה ולא משאיר גרסה מקוצרת שלה.

האם הוא מתאים לשמש כסוכן אוטונומי?

הביצועים שלו בהפעלת כלים נמוכים ועומדים על 28 אחוז בלבד. לא כדאי לבנות עליו משימות של קריאה לפונקציות מורכבות.

איך מריצים

המשקל כולו תופס שני גיגה בייט בלבד, כך שכרטיס מסך בסיסי לחלוטין מריץ אותו בלי מאמץ ב־bfloat16. עם זאת, הרחבת ההקשר עד 131,072 טוקנים דורשת הגדרות RoPE מבוססות YaRN וצורכת זיכרון משמעותי עבור ה־KV cache, כך שקלט ענק כבר ידרוש כרטיס מקצועי יותר.

שרתים כמו vLLM ו־SGLang תומכים בו, אך נדרש קוד מהמאגרים המעודכנים ושימוש בפרסרים ייעודיים להסקה וקריאות לכלים. אם המוצר שלכם לא צריך הפעלה אופליין או פרטיות מוחלטת, מודלים מסחריים גדולים דרך ממשקי ענן עדיין יתנו ביצועים יציבים יותר בלי כאב הראש של תחזוקת תשתית ושרתי הסקה מקומיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="IFM/K2-Horizon-0.9B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או כחלק ממוצר שנמכר ללקוחות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗