GPT
K

K-EXAONE-236B-A23B

קוד פתוח

LGAI-EXAONEother2025-12-26

  • transformers
  • safetensors
  • exaone_moe
  • text-generation
  • lg-ai

מודל ענק בתצורת מומחים עם חשיבה מובנית וחלון הקשר של 256K. הוא מיועד למי שמחפש יכולות תכנות, פתרון בעיות מתמטיות והפעלת כלים, בעיקר סביב קוריאנית ושפות מרכזיות נוספות.

  • 237Bפרמטרים
  • 262,144טוקנים בהקשר
  • 442 GBמשקל הקבצים
  • 16,261הורדות בחודש

מה זה

במקום להפעיל את כל 236 מיליארד הפרמטרים בכל מילה, הארכיטקטורה כאן מפעילה 23 מיליארד בלבד בכל רגע נתון. המודל מגיע עם מצב חשיבה מובנה כברירת מחדל, בדומה למודלים מודרניים אחרים, ומשלב חיזוי של מספר טוקנים קדימה כדי להאיץ את קצב הפליטה. ההקשר הארוך נשען על מנגנון קשב היברידי שמשלב חלון נע קצר לצד קשב גלובלי, מה שחוסך זיכרון בעבודה עם טקסטים ארוכים.

במבחני ביצועים התוצאות מראות חוזק מובהק במתמטיקה עם 92.8 נקודות ב־AIME 2025 ופתרון תקלות קוד מורכבות עם 49.4 נקודות ב־SWE-Bench Verified. עם זאת, הוא מפגר באופן ברור אחרי מודלים מקבילים כמו DeepSeek-V3.2 במשימות סוכן מסובכות של גלישה, שם הוא נעצר על 31.4 נקודות לעומת 51.4, ובמבחן הידע Humanity's Last Exam שבו השיג 13.6 בלבד.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג 92.8 ב־AIME 2025 ומנצל מנגנון חשיבה מובנה לחישובים מורכבים.

  • סוכן פעולות לקוריאנית

    משלב התאמה תרבותית מקומית ומציג מעל 70 נקודות במבחני שימוש בכלים.

  • סריקת מסמכים ארוכים

    תומך ברבע מיליון טוקנים עם קשב היברידי שמונע פיצוץ זיכרון.

איפה זה נופל

במשימות פיתוח מורכבות מול טרמינל הוא קיבל 29.0 נקודות ב־Terminal-Bench 2.0, נמוך בהרבה ממתחריו, כך שאי אפשר לסמוך עליו בעיניים עצומות לניהול סביבות פיתוח אוטומטיות. נקודת החיתוך של המידע שלו היא דצמבר 2024, מה שאומר שהוא ימציא עובדות או ייכשל לגמרי באירועים עדכניים. בנוסף, הוא אומן ונבדק על 6 שפות ספציפיות בלבד שאינן כוללות עברית, והכרטיס מזהיר במפורש מטעויות תחביריות והטיות סטטיסטיות מהדאטה.

שאלות
נפוצות

האם המודל תומך בעברית לשימוש עסקי?

המודל אומן ונבדק רשמית עבור אנגלית, קוריאנית, ספרדית, גרמנית, יפנית וויאטנמית בלבד. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן הוא צפוי להתקשות בניסוח, בהבנת ניואנסים ובחלוקת טוקנים יעילה.

האם אפשר להריץ אותו על שרת יחיד עם כרטיס RTX 4090?

ממש לא. מדובר במודל ששוקל 442 גיגה בייט ודורש 4 מעבדי H200 רק כדי להיטען ולעבוד בהקשר מלא. להרצה מקומית על כרטיס בודד תצטרכו גרסאות מכווצות מאוד וגם אז תהיו מוגבלים מאוד בהקשר ובמהירות.

למה התשובות שלו איטיות יחסית?

ברירת המחדל שלו היא מצב חשיבה פועל, מה שאומר שהוא מייצר שרשרת מחשבה לפני שהוא עונה. אם אתם צריכים זמן תגובה מהיר, יש להגדיר ידנית את הפרמטר לכבוי בתבנית השיחה.

איך מריצים

כדי להרים את המודל המלא תצטרכו להוריד 442 גיגה בייט של קבצים ולהחזיק חומרה רצינית מאוד. המפרסמים מציינים שנדרשים 4 כרטיסי H200 בתצורת חלוקת טנסורים כדי להריץ אותו עם חלון ההקשר המלא של 256K דרך מנועים כמו vLLM או SGLang. הוא נתמך גם ב־TensorRT-LLM ובגרסאות llama.cpp החל מ־b7737, וקיימת גרסת משקלים מכווצת ב־NVFP4 ו־GPTQ.

אם אין לכם שרת ייעודי כזה בחברה או בענן פרטי, העלויות וההתעסקות פשוט לא שוות את זה. במקרה כזה הרבה יותר הגיוני ומשתלם לפנות ישירות ל־API שמוצע דרך FriendliAI במקום לקנות או לשכור מכונות באלפי דולרים בחודש.

from transformers import pipeline

pipe = pipeline("text-generation", model="LGAI-EXAONE/K-EXAONE-236B-A23B")
print(pipe("שלום"))

הקבצים

109 קבצים במאגר, 442 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כהסכם רישוי ייעודי של K-EXAONE ולא רישיון קוד פתוח סטנדרטי דוגמת MIT או אפאצ'י. המשמעות היא שאתם חייבים לקרוא את מסמך הרישיון המצורף במאגר לפני שאתם משלבים אותו במוצר מסחרי, לוודא באילו תנאים מסחריים מותר להפיץ אותו, ולקחת בחשבון שיש בו הגבלות שימוש ספציפיות סביב פעילויות לא חוקיות ותוכן אסור.

הרישיון המלא בעמוד המודל ↗