GPT
S

Spark-X2.5-4B-GGUF

קוד פתוח

XHTokenapache-2.02026-08-28

  • gguf
  • llama.cpp
  • ollama
  • lm-studio
  • sparkx2_5

גרסת GGUF קומפקטית של 4 מיליארד פרמטרים שמציעה חלון הקשר ענקי של עד מיליון תווים. מתאימה למי שצריך הרצה מקומית של מודל קטן לעיבוד מסמכים ארוכים או סוכנים.

  • 14.2 GBמשקל הקבצים
  • 49,223הורדות בחודש
  • 123לייקים

מה זה

מדובר במודל שפונה לשימושים כלליים כמו שיחה, כתיבה, תרגום, תכנות והפעלת כלים במסגרת סוכנים אוטונומיים. המבנה שלו משלב ארכיטקטורת תשומת לב היברידית, וזה מה שמאפשר לו להציע תמיכה בהקשר של עד מיליון תווים למרות הגודל הצנוע שלו. לפי הדיווח הוא מכסה מעל 200 שפות, אם כי תגיות המאגר מציינות בעיקר אנגלית וסינית.

הייחוד העיקרי כאן מול מודלים אחרים בקטגוריית ה־4B הוא שילוב ההקשר העצום יחד עם מצב חשיבה מובנה. אם אתם צריכים לנתח קבצי ענק או לוגים ארוכים על חומרה מקומית בלי לפנות לענן, זה אחד הכיוונים הבודדים בגודל הזה שמכוון ישירות לשם.

מתאים ל

  • קריאת מסמכים ארוכים

    חלון של עד מיליון תווים מאפשר להזין תיעוד טכני מלא או קבצי טקסט שלמים מקומית.

  • סוכנים והפעלת כלים

    הארכיטקטורה תוכננה למשימות של שימוש בכלים וזרימות עבודה של סוכנים.

  • פיתוח אוטומטי מבוסס קוד

    מתאים למשימות תכנות בסיסיות שדורשות שמירה על הקשר פרויקט רחב יחסית.

איפה זה נופל

הבעיה המרכזית היא התלות בפורק ייעודי של llama.cpp, מה שאומר שכל עדכון גרסה של Ollama או LM Studio עלול לשבור לכם את ההתקנה. מעבר לכך, למרות ההבטחה לתמיכה במעל 200 שפות, המטא-דאטה מגדיר אנגלית וסינית בלבד, כך שיכולות העברית שלו דורשות בדיקה זהירה וממש לא מובטחות. הריצה בהקשר של מיליון טוקנים ב־BF16 תדרוש כמות עצומה של זיכרון למרות גודל המודל הבסיסי.

אותה משפחה

Spark-X2.5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד ישר בהתקנת Ollama רגילה?

לא. לפי התיעוד חובה להוריד את קוד המקור של Ollama יחד עם הפורק של llama.cpp מבית XHToken ולקמפל אותם יחד לפני שאפשר לטעון את הקובץ.

מה המשמעות של דגל think בעת ההרצה?

המודל כולל מנגנון חשיבה מובנה לפתרון בעיות מורכבות. העברת הדגל think=false מכבה את שלב החשיבה ומחזירה תשובות ישירות ומהירות יותר.

איך מריצים

כדי להריץ אותו דרך Ollama או LM Studio תצטרכו לקמפל גרסה מותאמת של llama.cpp מתוך מאגר הגיטהאב של XHToken, כי הקוד הראשי כנראה עדיין לא תומך בארכיטקטורה הזו מהקופסה. ההמרה הנוכחית היא BF16 ושוקלת כ־14.2 גיגה-בייט, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון או מעבד אפל עם זיכרון מאוחד דומה כדי להריץ אותה בנוחות.

אם אין לכם כוח להתעסק עם קומפילציות ידניות של מנוע ההרצה והחלפת ספריות מערכת, או שאין לכם חומרה פנויה להקשרים ארוכים שזוללים זיכרון מהר, עדיף להשתמש ב־API מרוחק.

ollama run hf.co/XHToken/Spark-X2.5-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗