GPT
E

EXAONE-4.0-1.2B

קוד פתוח

LGAI-EXAONEother2025-07-11

  • transformers
  • safetensors
  • exaone4
  • text-generation
  • lg-ai

מודל קטן במיוחד ששוקל 2.4 גיגה בלבד, עם מצב חשיבה מובנה ותמיכה בהפעלת כלים. הוא מתאים למי שרוצה להריץ סוכן מקומי ישירות על מכשיר קצה בלי להחזיק שרת כבד.

  • 1.3Bפרמטרים
  • 65,536טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 22,399הורדות בחודש

מה זה

LG פיתחו כאן גרסה קומפקטית שמביאה יכולות של מודלים גדולים למכשירים חלשים. החידוש העיקרי הוא האפשרות לעבור בין מצב רגיל ומהיר לבין מצב שפותח בלוק חשיבה עצמאי לצורך פתרון בעיות מורכבות יותר, לצד יכולת מובנית לקרוא לכלים חיצוניים.

בגודל הזה של 1.3 מיליארד פרמטרים, רוב המודלים מוגבלים לתשובות בסיסיות מאוד. לפי מבחני הביצועים במצב החשיבה, הוא מקבל 71.5 בבדיקת ידע כללי של MMLU-Redux, תוצאה שעוקפת מודלים ישנים יותר של החברה כמו EXAONE Deep בעל 2.4 מיליארד פרמטרים, ומתקרבת לביצועים של מודלים ששוקלים כמעט כפול ממנו.

מתאים ל

  • סוכן חכם על מכשיר קצה

    הוא כולל תמיכה בהפעלת כלים ומסוגל לרוץ מקומית על לפטופ או חומרה חלשה בלי גישה לרשת.

  • פתרון בעיות לוגיות קלות

    מצב החשיבה המובנה מאפשר לו לפרק שאלות מורכבות לפני מתן תשובה סופית, דבר נדיר במודל כה קטן.

  • עיבוד טקסט בספרדית

    המודל אומן מפורשות על ספרדית לצד אנגלית וקוריאנית, ומאפשר לבצע משימות בלי שרת ענן ייעודי.

איפה זה נופל

השפות הנתמכות הן אנגלית, קוריאנית וספרדית בלבד. עברית לא נתמכת כאן, ואם תנסו להריץ עליו טקסט מקומי תקבלו פלט שבור או חסר משמעות. מודל של 1.2 מיליארד פרמטרים תמיד נוטה להזיות כשהמשימה מסתבכת, גם כשהוא משתמש במצב חשיבה. בנוסף, רכיב החשיבה רגיש מאוד לפרמטרי הדגימה, ואם לא תכוונו נכון את הטמפרטורה תקבלו תשובות לא עקביות. מנועי הסקה כמו sglang עדיין לא תומכים בו.

אותה משפחה

EXAONE-4.0 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה למוצר בעברית?

לא. החברה הגדירה תמיכה באנגלית, קוריאנית וספרדית בלבד. הוא לא אומן על עברית ולא יתפקד בה כשורה.

כמה זיכרון כרטיס מסך נחוץ כדי להריץ אותו בפועל?

המודל שוקל 2.4 גיגה בפורמט bfloat16. כרטיס מסך פשוט עם 4 עד 6 גיגה יספיק להרצה מקומית חלקה, כולל מקום לטוקנים הנוספים של חלון ההקשר.

איך מפעילים את מצב החשיבה בקוד?

מעבירים את הפרמטר enable_thinking שווה ל־True למפענח הטוקנים. הפעולה הזו פותחת תגית מיוחדת שגורמת לו להציג את תהליך ההסקה לפני התשובה.

איך מריצים

בזכות משקל של 2.4 גיגה בפורמט bfloat16, אפשר להריץ אותו כמעט על כל מחשב פיתוח מודרני, טלפון חזק או כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון. transformers מגרסה 4.54.0 ומעלה מריצה אותו ישירות בקוד פייתון פשוט, ומי שצריך שרת הפקה יכול להשתמש בגרסה 0.10.0 של vLLM או לקמפל מגרסת הפיתוח של TensorRT-LLM.

אם אתם צריכים רק מדי פעם מענה לשאלות מורכבות בענן, עדיף להשתמש בנקודות קצה מוכנות ברשת במקום לתחזק שרת. הרצה מקומית משתלמת כשרצים על מכשיר הקצה עצמו או כשחייבים פרטיות מלאה בלי להוציא מידע החוצה.

from transformers import pipeline

pipe = pipeline("text-generation", model="LGAI-EXAONE/EXAONE-4.0-1.2B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית ולא כקוד פתוח סטנדרטי. לפי הפרסום של LG התנאים עודכנו לשימוש גמיש יותר, אך יש לבדוק את מסמך הרישיון המלא לפני שילוב שלו במוצר מסחרי כדי לוודא שאין מגבלות הפצה או דרישות דיווח.

הרישיון המלא בעמוד המודל ↗