GPT
K

K-EXAONE-2.0-750B-A37B

קוד פתוח

LGAI-EXAONEapache-2.02026-07-29

  • transformers
  • safetensors
  • exaone_moe
  • text-generation
  • lg-ai

ענק בקוד פתוח עם 749 מיליארד פרמטרים שמפעיל רק 37 מיליארד בכל טוקן. הוא נבנה עבור משימות ארוכות טווח בקוריאנית ובעוד תשע שפות, עם חלון הקשר עצום ובלי עלויות רישוי מסחרי.

  • 749Bפרמטרים
  • 262,144טוקנים בהקשר
  • 1.4 TBמשקל הקבצים
  • 2,826הורדות בחודש

מה זה

מדובר במודל MoE עצום שפותח על ידי זרוע הבינה המלאכותית של LG. מתוך 749 מיליארד פרמטרים בסך הכול, רק 37 מיליארד רצים בפועל על כל טוקן הודות לניתוב בין 256 מומחים שונים. המבנה הזה נועד לתת ביצועים של מודל ענק בלי לדרוש את כל כוח החישוב בבת אחת, והוא כולל תמיכה מובנית בחלון הקשר של 262,144 טוקנים.

במבחני ביצועים הוא מראה קפיצה ברורה ביחס לגרסה הקודמת שלו, במיוחד במשימות קוד ומעקב אחר הוראות מורכבות. עם זאת, מול מתחרים בקטגוריית המשקל שלו הוא לא מוביל את הטבלה בכל תחום. הוא מצטיין בעיקר באחזור מתוך הקשר ארוך עם תוצאה של 94.4 במבחן OpenAI-MRCR ובמדדי בטיחות מחמירים, אך בפתרון בעיות מתמטיקה וקוד מורכבות כמו SWE Bench Verified הוא משיג 68.2 אחוזים, שזה נתון טוב אבל נמוך יותר מחלק מהמתחרים הסיניים והאמריקאיים המקבילים.

מתאים ל

  • ניתוח מסמכים מרובי שפות

    חלון של 262 אלף טוקנים מאפשר לעבד חוזים ומסדי ידע שלמים באנגלית ובקוריאנית.

  • אוטומציה וסוכני תוכנה

    ארכיטקטורת MoE עם פענוח ספקולטיבי מאיצה מענה בלולאות הרצה של סוכנים.

  • מערכות עם דרישות בטיחות

    המודל קיבל 99.8 במבחן הבטיחות KGC ומציג סינון מחמיר במיוחד של פלטים.

איפה זה נופל

החיסרון הבולט ביותר הוא המחסור המוחלט בתמיכה בעברית. רשימת השפות כוללת עשר שפות בלבד, בהן קוריאנית, אנגלית, ספרדית, גרמנית ופולנית, כך שהוא לא מתאים לעיבוד טקסט מקומי בישראל. בנוסף, במבחני ידע כללי קשים במיוחד כמו Humanity's Last Exam הוא קיבל ציון של 18.3 בלבד, שמצביע על גבולות ברורים בחשיבה מדעית מורכבת. קיימת גם תלות בגרסאות מזלג ספציפיות של SGLang ו־transformers לצורך הרצה, מה שמסבך את ההטמעה.

אותה משפחה

K-EXAONE-2.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי A100?

לא. המשקולות שוקלות 1.4 טרה־בייט בזיכרון, מה שדורש אשכול שרתים עם לפחות 16 כרטיסי H200 של 141 גיגה כדי לטעון אותו ולשרת בקשות בהקשר מלא.

האם הוא יודע לענות ולעבד תוכן בעברית?

המודל לא אומן על עברית ולא כולל אותה ברשימת השפות הנתמכות. לא הייתי משתמש בו לשום יישום שדורש הבנה או יצירה של עברית.

איך מריצים

כדי להריץ אותו מקומית תצטרכו חומרה ארגונית כבדה מאוד. המשקל הכולל של הקבצים מגיע ל־1.4 טרה־בייט בפורמט BF16, והתיעוד הרשמי מדגים פריסה באמצעות SGLang על גבי שני צמתים של שמונה כרטיסי NVIDIA H200 כל אחד, כלומר 16 מאיצים בסך הכול עם חלוקת Tensor Parallel של 16.

אם אין לכם אשכול שרתים ייעודי ותקציב חומרה של מאות אלפי שקלים, אין טעם לנסות להרים אותו על שרת בודד. המפתחים מציעים גישה חלופית דרך ממשק API בשירות FriendliAI או התנסות בדמו מקוון, וזו הדרך השפויה היחידה לבדוק אותו עבור רוב המפתחים.

from transformers import pipeline

pipe = pipeline("text-generation", model="LGAI-EXAONE/K-EXAONE-2.0-750B-A37B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון Apache 2.0 מלא. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות, שילוב במוצרים פרטיים והפצה מחדש, ללא תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗