GPT
A

A.X-4.0-Light

קוד פתוח

sktapache-2.02025-07-02

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

גרסה מוקטנת של 7.3 מיליארד פרמטרים שחברת התקשורת הדרום קוריאנית SK Telecom אימנה על בסיס Qwen2.5. המטרה כאן היא ביצועים חזקים בקוריאנית ובאנגלית בלי לשלם בחומרה כבדה.

  • 7.3Bפרמטרים
  • 16,384טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 45,012הורדות בחודש

מה זה

מדובר במודל שפת בסיס עם כיוונון לקוריאנית, שמיועד לעבוד מהר ובמשאבים צנועים יחסית לאחיו הגדול בעל 72 מיליארד הפרמטרים. המפתחים לקחו את הארכיטקטורה של Qwen2.5 והוסיפו אימון מסיבי על דאטה קוריאני, מה שמביא אותו להוציא ציונים טובים יותר ממודל המקור באותה שפה, כמו 64.15 במבחן הידע KMMLU לעומת 49.56 ב־Qwen2.5-7B.

במשימות כלליות באנגלית הוא שומר על קו דומה למקורות שלו, עם 75.43 ב־MMLU ו־84.68 במעקב אחר הוראות ב־IFEval. ההבדל המרכזי מול מתחרים באותו משקל הוא השילוב בין הבנה תרבותית מקומית בקוריאנית לבין יכולת טכנית סבירה בקוד ובמתמטיקה, כפי שמשתקף ב־68.88 במבחן MATH.

מתאים ל

  • עיבוד טקסט בקוריאנית

    ניתוח מסמכים ומענה לשאלות בקוריאנית על חומרה מקומית זולה יחסית.

  • בוטים עם חיבור לכלים

    הרצה קלה דרך vLLM עם תמיכה מובנית בקריאה לפונקציות ואינטגרציות.

  • סיווג ותרגום אנגלית קוריאנית

    הבנה טובה של מונחים מקומיים לצד דיוק שפתי גבוה בשתי השפות הנתמכות.

איפה זה נופל

הנקודה החלשה ביותר היא תכנות מורכב. במבחן LiveCodeBench המודל מגרד 18.03 נקודות בלבד, שזה ציון נמוך שמעיד על קושי בכתיבת קוד אמיתי מעבר למשימות בסיסיות. בנוסף, חלון ההקשר כאן מוגבל ל־16,384 טוקנים, בניגוד לגרסת ה־72B שתומכת בהקשרים ארוכים בהרבה, ולכן הוא לא מתאים לעיבוד ספרים או מסמכים ענקיים. חשוב גם לזכור שהוא תומך רשמית רק בקוריאנית ובאנגלית, כך שאין מה לצפות לביצועים בעברית.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

לא. המודל אומן והוגדר רשמית רק עבור אנגלית וקוריאנית. ניסיון לעבוד איתו בעברית יפיק תוצאות גרועות או ג'יבריש, ולא כדאי לבנות עליו לפרויקטים מקומיים בישראל.

מה היתרון שלו מול מודל Qwen2.5 המקורי?

אם אתם עובדים מול השוק הקוריאני, השיפור משמעותי. לפי הבנצ'מרקים בכרטיס המודל, הוא עוקף את Qwen2.5-7B בפער ניכר במבחני ידע, שפה ותרבות מקומית, בעוד שבשאר היכולות הוא נשאר ברמה מקבילה.

איך מריצים

המשקל הגולמי בדיוק bfloat16 תופס 13.5 גיגה בייט, כך שכרטיס מסך בודד עם 16 או 24 גיגה זיכרון מריץ אותו בלי בעיה. אם תרצו לחבר vLLM, הכרטיס דורש גרסה 0.6.4.post1 לפחות, כולל תמיכה מובנית בהפעלת כלים וקריאות לפונקציות באמצעות הפרסר של הרמס.

יש למפתחים גם שרת צ'אט ו־API רשמי בחינם, כך שאם אתם רק בודקים התכנות או לא רוצים להחזיק תשתית ענן רציפה, עדיף לפנות ישירות לשרת שלהם במקום לשלם על שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="skt/A.X-4.0-Light")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 המלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, לארח אותו בתוך שירותים פרטיים ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗