GPT
A

A.X-K1

קוד פתוח

sktapache-2.02025-12-29

  • transformers
  • safetensors
  • axk1
  • text-generation
  • conversational

מודל ענק בארכיטקטורת מומחים עם חשיבה גמישה, שמכוון בעיקר לקוריאנית, אנגלית וקוד. מי שבוחר בו מחפש ביצועים של מודל ענק עם זמני ריצה של 33 מיליארד פרמטרים פעילים.

  • 519Bפרמטרים
  • 131,072טוקנים בהקשר
  • 967 GBמשקל הקבצים
  • 9,466הורדות בחודש

מה זה

זהו מודל MoE עם 519 מיליארד פרמטרים בסך הכל, שמאמן מהיסוד ללא הסתמכות על משקלים קודמים. בכל צעד מופעלים רק 33 מיליארד פרמטרים מתוך 192 מומחים קיימים, מה שמאפשר להריץ היקש יחסית יעיל לגודל כזה. הוא תומך במעבר מובנה בין מצב חשיבה מעמיק שמציג שלבי פתרון למצב מהיר ללא שלבי ביניים. הטוקנייזר שלו מותאם לחמש שפות, בהן אנגלית וקוריאנית, עם דגש חזק על קוד ומבני נתונים.

במדדי קוד ומתמטיקה הוא מציג תוצאות חזקות, למשל 89.8 נקודות במבחן AIME25 באנגלית ו־75.8 ב־LiveCodeBench במצב חשיבה, ועוקף שם מודלים כמו DeepSeek-V3.1. עם זאת, במצב ללא חשיבה התוצאות צונחות בצורה ניכרת, כולל ירידה ל־79.9 ב־HumanEval+ לעומת 87.2 במצב המלא. בנוסף, הוא נבנה עם תמיכה בחיזוי מרובה טוקנים כדי לסייע בריצה עם דגימה ספקולטיבית.

מתאים ל

  • פתרון בעיות מתמטיקה

    מתאים למשימות חישוביות סבוכות בזכות ציון 89.8 ב־AIME25 במצב חשיבה.

  • מחולל קוד בשפות מרובות

    מציג 75.8 נקודות ב־LiveCodeBench וטוקנייזר שנבנה במיוחד למבני תחביר.

  • עיבוד טקסט בקוריאנית

    תוכנן ישירות עבור השפה ומוביל במבחני KMMLU ו־KMO מקומיים.

איפה זה נופל

החולשה הבולטת ביותר היא ביצועים בהקשר ארוך, שם הוא קיבל רק 36.0 נקודות במבחן AA-LCR לעומת מעל 53 במודלים מתחרים, ורק 8.6 במבחן הקשה Humanity's Last Exam. בנוסף, היוצרים מדגישים ששלבי ההסבר במצב חשיבה אינם מייצגים בהכרח את תהליך קבלת ההחלטות האמיתי של הרשת. אין גם נתונים או תמיכה רשמית בעברית, כך שלא כדאי לבנות עליו למשימות בשפה המקומית.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת יחיד עם כרטיס גרפי חזק?

לא. משקל המודל הוא 967 ג'יגה-בייט, מה שמחייב חלוקה בין מספר כרטיסים ושרתים שונים. הדוגמה הרשמית מבוססת על ארבעה שרתי עיבוד מחוברים יחד.

מה ההבדל בין מצב Think למצב הרגיל בריצה?

מצב Think מפיק שרשרת חשיבה מפורטת לפני מתן התשובה ומביא לתוצאות גבוהות יותר במבחני קוד ומתמטיקה. מצב Non-Think מייצר תשובות קצרות ומהירות יותר אך פוגע משמעותית ברמת הביצועים.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו תשתית שרתים כבדה מאוד. המשקלים לבדם תופסים 967 ג׳יגה־בייט ב־bfloat16, כך שמדובר באשכול של מספר שרתים מרובי כרטיסי מסך, למשל ארבעה שרתים בתצורת Tensor Parallel של 32 כרטיסים כפי שמציגים בדוגמת הריצה של SGLang. יש גם תמיכה ראשונית ב־vLLM ודוגמאות ל־Transformers.

גרסאות מכווצות או קלות אינן זמינות להורדה פתוחה ישירה והיוצרים דורשים פנייה במייל כדי לקבל אותן. אם אין לכם גישה לאשכול שרתים ייעודי עם מאות גיגות זיכרון וידאו ותקציב חשמל בהתאם, הרצה עצמית פשוט אינה מעשית בשלב זה.

from transformers import pipeline

pipe = pipeline("text-generation", model="skt/A.X-K1")
print(pipe("שלום"))

הקבצים

77 קבצים במאגר, 967 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה מחדש, בכפוף לשמירה על הצהרת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗