GPT
A

A.X-K2

קוד פתוח

sktapache-2.02026-07-28

  • transformers
  • safetensors
  • axk2
  • text-generation
  • conversational

מודל ענק בארכיטקטורת מומחים עם חשיבה מובנית וחלון ענק. הוא מצטיין בעיקר בפתרון בעיות מתמטיות קשות ובעבודה מול טקסטים בקוריאנית.

  • 692Bפרמטרים
  • 262,144טוקנים בהקשר
  • 647 GBמשקל הקבצים
  • 114,040הורדות בחודש

מה זה

מדובר במודל שכולל 688 מיליארד פרמטרים בסך הכול, אך מפעיל רק 33 מיליארד פרמטרים בכל טוקן דרך מנגנון של ניתוב לשמונה מומחים. המבנה הזה מאפשר לו לרוץ בקצב סביר יחסית לגודל העצום שלו. המודל תוכנן לעבודה בשני מצבים לבחירה: מצב חשיבה שמפרט שלבי הסקה לוגיים לפתרון בעיות מורכבות, ומצב רגיל שמחזיר תשובות ישירות ומהירות כדי לחסוך זמן עיבוד.

במבחני מתמטיקה הוא מגיע לצמרת העולמית. במבחן AIME26 הוא קיבל 97.1 ובמבחן Apex הוא הגיע ל־45.8, תוצאות שמציבות אותו מעל מודלים פתוחים מובילים אחרים. מנגד, ביכולות תכנות כלליות וסוכן רשת הוא פחות מרשים: במבחן LiveCodeBench הוא קיבל 84.0 ובמבחן הגלישה BrowseComp הוא השיג 9.3 בלבד, הרבה מאחורי מודלים מתחרים.

מתאים ל

  • פתרון בעיות במתמטיקה מתקדמת

    מצב החשיבה שלו מגיע להישגים ברמת אולימפיאדה ומנצח מודלים מתחרים במבחני AIME ו־Apex.

  • ניתוח מסמכים ארוכים בקוריאנית

    הוא תומך בחלון של 256K טוקנים ומציג תוצאות מובילות במבחני הבנה בשפה הקוריאנית.

  • מערכות מענה גמישות השהיה

    היכולת לבחור בכל בקשה בין מצב חשיבה עמוק לתשובה ישירה מאפשרת לשלוט בעלויות ובזמני התגובה.

איפה זה נופל

המודל מוגבל אך ורק לטקסט ואינו תומך בתמונות או אודיו כלל. למרות גודלו, ביצועי הסוכן שלו בסביבות מורכבות חלשים מאוד. במבחן פעולות הבנקאות של טאו 3 הוא קיבל 13.0 בלבד ובמבחן הגלישה ברשת הוא כשל כמעט לחלוטין מול המתחרים. בנוסף, הוא אומן בעיקר על חמש שפות: אנגלית, קוריאנית, סינית, יפנית וספרדית. אין לו שום התאמה רשמית לעברית, ולכן פניות בעברית ייצרו כנראה הזיות או שימוש בטוקניזציה לא יעילה.

שאלות
נפוצות

האם כדאי להוריד אותו לשימוש באפליקציה בעברית?

לא. המודל אומן על אנגלית, קוריאנית ושפות מזרח אסיה, ללא התייחסות לעברית בחומרי האימון. השילוב בין גודל חריג לחוסר תמיכה בשפה הופך אותו ללא משתלם לפרויקטים מקומיים.

איך בוחרים בין מצב חשיבה מעמיק למענה מהיר?

השליטה נעשית ברמת הבקשה באמצעות דגל ייעודי בתבנית השיחה או בפרמטרים של השרת. במצב חשיבה התשובה כוללת תגיות עם שרשרת ההסקה, ובמצב רגיל המודל מדלג עליהן ומחזיר פלט קצר מיד.

איך מריצים

כדי להריץ אותו עצמאית נדרשת חומרת קצה רצינית מאוד. המשקלים שמורים בפורמט FP8 ותופסים 647 גיגה בייט על הדיסק, כך שבפועל צריך לפחות 800 גיגה בייט של זיכרון כרטיסי מסך כדי לטעון אותם יחד עם הקשר העבודה. הבדיקות הרשמיות דרשו ארבעה כרטיסי B300 עם 275 גיגה בייט כל אחד, או לחלופין לפחות שנים עשר כרטיסים של 80 גיגה בייט. כרטיסים ישנים ימירו את המשקלים חזרה וידרשו מעל טרה בייט וחצי של זיכרון.

ההרצה מתבצעת בספריית transformers ישירות מהקוד, או דרך גרסה מותאמת של vLLM שמנצלת את מנגנון הקשב הדליל עבור חלון ההקשר המלא של 256K. אם אין לכם אשכול שרתים ייעודי ותקציב חומרה משמעותי, אין שום סיבה הגיונית לנסות להרים אותו על שרת פרטי ועדיף לצרוך מודלים בגודל הזה כשירות ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="skt/A.X-K2")
print(pipe("שלום"))

הקבצים

363 קבצים במאגר, 647 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0 מלא. הרישיון מתיר שימוש מסחרי, שינוי של המשקלים, הפצה ואירוח עצמי ללא תשלום תמלוגים, ובלבד ששומרים על הודעת זכויות היוצרים המקורית. המפתחים מבהירים שאין להסתמך עליו כמקבל החלטות יחיד בתחומים קריטיים כמו רפואה, חוק או פיננסים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗