GPT
A

A.X-4.0

קוד פתוח

sktother2025-07-02

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל ענק שעבר אימון ייעודי לקוריאנית ומנצח מבחנים מקומיים. הוא שווה בדיקה רק אם אתם בונים שירות לשוק הדרום קוריאני שצריך דיוק תרבותי גבוה.

  • 72Bפרמטרים
  • 131,072טוקנים בהקשר
  • 134 GBמשקל הקבצים
  • 1,826הורדות בחודש

מה זה

מדובר במודל של 72 מיליארד פרמטרים שנבנה על בסיס Qwen2.5 של עליבאבא ועבר אימון המשך על דאטה רחב בקוריאנית. הדגש פה הוא התאמה עסקית ותרבותית למדינה אחת, לצד תמיכה באנגלית.

במבחני ידע מקומיים כמו KMMLU הוא מגיע לציון 78.32 ועוקף את GPT-4o שעומד על 72.51. גם במבחן ההבנה התרבותית CLIcK הוא מוביל עם 83.51 לעומת 80.22. בנוסף, החברה מדווחת על חיסכון של כשלושים ושלושה אחוזים בכמות הטוקנים עבור אותו קלט בקוריאנית בהשוואה למודל של OpenAI. עם זאת, במבחני קוד כלליים כמו LiveCodeBench הוא קיבל 26.07 בלבד, נמוך יותר אפילו מ־Qwen2.5 המקורי, כך שההתמחות שלו ברורה מאוד.

מתאים ל

  • עיבוד מסמכים ארוכים בקוריאנית

    חלון של מעל מאה ושלושים אלף טוקנים לצד ידע תרבותי מעמיק מתאימים לניתוח חוזים ומסמכים עסקיים מקומיים.

  • צ'אטבוט ארגוני לשוק הקוריאני

    הוא חוסך שליש מהטוקנים לעומת מודלים כלליים ומוביל במבחני הבנת הנחיות ושפה מדוברת באזור.

  • מערכות RAG מבוססות ידע מקומי

    ציונים גבוהים במבחני KMMLU ו־CLIcK נותנים יתרון בשליפת עובדות והקשרים מדויקים בקוריאה.

איפה זה נופל

המודל ממוקד כולו בשתי שפות בלבד, קוריאנית ואנגלית, ולכן כל שימוש בעברית או בשפות אחרות חסר משמעות כאן. מעבר לזה, במשימות תכנות הוא מציג חולשה יחסית ונופל מגרסת הבסיס שעליה הוקם. שימוש בכלים קיבל ציון של כ־86 אחוזים ב־FunctionChatBench, בעוד ש־GPT-4o מגיע ליותר מ־95 אחוזים באותו מבחן בדיוק, כך שפעולות אוטונומיות מורכבות עלולות להיכשל.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן והותאם אך ורק לאנגלית ולקוריאנית. אין לו תמיכה רשמית בעברית ולא כדאי להריץ אותו עבור תוכן מקומי בישראל.

מה עדיף, להריץ אותו עצמאית או להשתמש ב־API?

הרצה עצמאית דורשת שרת ייעודי ויקר של שני כרטיסי 80 גיגה לפחות. אם אין לכם דרישת אבטחה שמחייבת התקנה מקומית, עדיף לבדוק את ה־API שהם מספקים או לפנות לגרסת ה־7B הקלה.

איך מריצים

משקל הקבצים עומד על 134 גיגה בייט בדיוק bfloat16, מה שאומר שצריך לפחות שני כרטיסי A100 או H100 של 80 גיגה כדי לטעון אותו לזיכרון לפני שמתחילים לדבר על חלון הקשר מלא.

המפתחים ממליצים להריץ אותו דרך vLLM מגרסה 0.6.4.post1 ומעלה עם הגדרות ספציפיות לקריאות כלים, או דרך ספריית transformers החל מגרסה 4.46.0. אם אתם לא מחזיקים שרתים כאלה, עדיף להשתמש בגרסת ה־API החינמית שהם מציעים או לבדוק את גרסת ה־Light הקטנה יותר שמחזיקה שבעה מיליארד פרמטרים בלבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="skt/A.X-4.0")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט של תנאי שימוש פתוחים בכרטיס המודל. כדי להפיץ אותו בתוך מוצר מסחרי צריך ליצור קשר ישיר במייל עם המפתחים ולוודא מה המגבלות וההסכמים שהם דורשים.

הרישיון המלא בעמוד המודל ↗