GPT
S

Spark-X2.5-4B

קוד פתוח

XHTokenapache-2.02026-08-24

  • transformers
  • safetensors
  • spark2_5
  • text-generation
  • llm

מודל קומפקטי שמביא חלון הקשר עצום של מיליון טוקנים יחד עם התמחות בסוכנים אוטונומיים. הוא שווה בדיקה אם אתם מחפשים כלי קל להרצה עצמית שיודע להפעיל כלים ולכתוב קוד.

  • 4.1Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 7.7 GBמשקל הקבצים
  • 10,661הורדות בחודש

מה זה

מדובר במודל שפה בגודל 4.1 מיליארד פרמטרים, שמתמקד בריצה מקומית, אוטומציות ושימוש בכלים. כדי לתמוך בחלון של מיליון טוקנים בלי לחנוק את החומרה, הוא משתמש בארכיטקטורת קשב היברידית, שכבה אחת של קשב מלא לצד שלוש שכבות של חלון נע. הסידור הזה שומר על גודל סביר של זיכרון ה־KV גם בקבצים כבדים.

במבחני סוכנים כמו tau3-bench ו־MCP-Atlas הוא עוקף מתחרים פתוחים בקטגוריה שלו ואף מודלים גדולים יותר. לעומת זאת, בבנצ'מרקים קלאסיים של ידע כללי ומבחני שאלות מורכבים כמו GPQA או HLE הוא נשאר מוגבל ביחס לגודלו, כך שהיתרון המרכזי שלו הוא ביצוע פעולות, קריאה ל־APIs והרצת קוד, ולא בהכרח אנציקלופדיה שלמה.

מתאים ל

  • סוכני קוד פנימיים

    אינטגרציה מובנית עם סביבות כמו Codex ו־Claude Code מאפשרת אוטומציה של בדיקות ותיקוני תוכנה מקומית.

  • פרוטוקול MCP וכלים

    תוצאות גבוהות במבחני MCP-Atlas הופכות אותו למתאים במיוחד לפירוק משימות והפעלת פונקציות ברקע.

  • ניתוח לוגים ארוכים

    ארכיטקטורת הקשב ההיברידית יודעת לעבד כמויות מידע גדולות ביעילות גבוהה של ה־KV cache.

איפה זה נופל

חלון של מיליון טוקנים עלול להטעות, כיוון שניצול מלא של כל הטווח ידרוש נפח זיכרון חריג, הרבה מעבר למה שכרטיס ביתי ממוצע מסוגל להציע. בנוסף, המודל עובד כברירת מחדל במצב חשיבה שמאט את קצב הפקת הטוקנים הראשוני, ובמשימות מתמטיקה או פתרון קוד ב־SWE-Bench Verified מודלים ייעודיים גדולים עדיין עוקפים אותו בפער ניכר.

אותה משפחה

Spark-X2.5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מק ללא כרטיס של אנבידיה?

כן. הפרויקט כולל תמיכה ייעודית בחומרת Apple silicon באמצעות ספריית Spark-MLX-LLM, ללא צורך בהמרת המשקלים לפורמט GGUF לפני ההרצה.

איך מבטלים את מנגנון החשיבה אם צריך תגובות מהירות?

בתבנית השיחה ובשרתי SGLang המנגנון פעיל כברירת מחדל. כדי לעקוף אותו ולקבל פלט ישיר, מגדירים בפרמטרי הבקשה את הערך enable_thinking כ־false.

איך מריצים

המשקל עומד על 7.7 גיגה בייט, מה שאומר שכרטיס מסך בודד עם 16 גיגה של VRAM מחזיק אותו בקלות בריצה סטנדרטית. המודל רץ ישירות דרך vLLM ו־SGLang עם שרת תואם OpenAI, ונתמך גם ב־MLX למחשבי אפל, או ב־Ollama ו־LM Studio דרך בנייה מותאמת של llama.cpp. חוץ ממעבדי NVIDIA, יש תמיכה מובנית במאיצי Ascend, Hygon ו־HOUMO.AI.

אם אתם צריכים רק שאילתות קצרות וטקסט כללי, שירותי API ענן חוסכים את כל ההתעסקות. הרצה מקומית מומלצת בעיקר אם אתם בונים תהליכי סוכנים שדורשים זמני תגובה מהירים, שמירה על פרטיות הקוד, או ניצול של חלון ההקשר הגדול ללא עלויות פר טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="XHToken/Spark-X2.5-4B")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לאמן מחדש ולשלב במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗