GPT
N

NeoHorse-1-4B

קוד פתוח

TokenRhythmapache-2.02026-09-05

  • transformers
  • safetensors
  • qwen3_5_text
  • text-generation
  • agentic

גרסה ממוקדת סוכנים של Qwen3.5-4B שמיועדת לקריאות כלים וכתיבת קוד. אם אתם מחפשים מודל קומפקטי להרצה מקומית עם חלון הקשר עצום, זו נקודת פתיחה מעניינת.

  • 4.2Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.9 GBמשקל הקבצים
  • 1,771הורדות בחודש

מה זה

מדובר במודל שפה בגודל 4.2 מיליארד פרמטרים שעבר אימון המשך על ידי TokenRhythm על גבי Qwen3.5-4B. המפתחים ארזו אותו מחדש רק כמודל טקסט, ללא משקלי הראייה שהיו במקור, במטרה להתמקד במשימות של הפעלת כלים, כתיבת קוד ומעקב אחרי הוראות. חלון ההקשר שלו מגיע ל־262,144 טוקנים ישירות מהקופסה, עם יכולת הרחבה תיאורטית מעבר לכך.

במבחני הביצועים הוא מציג ממוצע של 64.87 בעשרה מבחנים שונים, שיפור של כמעט שש נקודות ביחס למודל הבסיס שלו. היתרון המשמעותי ביותר שלו נרשם במשימות סוכנים כמו WorkBuddy Bench ו־QwenClawBench, ובמבחני קוד בסיסיים כמו HumanEval שבו השיג 96.95. זה אומר שבמשימות של פירוק הוראות לפקודות ולכלים הוא מייצר פחות שגיאות תחביר מאשר מודל הבסיס.

מתאים ל

  • סוכן מקומי להפעלת כלים

    הוא אומן על מסלולי ביצוע ומציג 88.46 ב־tau2-Bench, מה שהופך אותו למועמד טוב להרצת סקריפטים וכלים במכונה מקומית.

  • עוזר השלמת קוד פנימי

    עם ציון של 96.95 ב־HumanEval ומשקל של 7.9 גיגה-בייט בלבד, הוא מתאים לשרת פיתוח קטן שאינו מחובר לרשת.

  • מעקב אחר הוראות מובנות

    תוצאה של 88.35 ב־IFEval מאפשרת לו לחלץ נתונים ולשמור על פורמט פלט מוגדר היטב.

איפה זה נופל

למרות השדרוג ביחס למודל הבסיס, בגודל של 4B יש גבול ברור לעומק ההבנה. במבחן BFCL v4 הוא קיבל 61.79 בלבד, פחות ממתחרים כמו Nanbeige-4.2-3B שהגיע ל־67.28, מה שאומר שהוא עדיין מפספס בקריאות לפונקציות מורכבות. גם במבחן הקוד LiveCodeBench v6 הוא הגיע ל־59.43 לעומת 72.50 של מתחרים, כך שאל תצפו ממנו לתקן באגים עמוקים בפרויקטים שלמים.

אותה משפחה

NeoHorse-1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל כולל יכולות עיבוד תמונה כמו המודל המקורי?

לא. המפתחים הסירו את משקלי הראייה של Qwen3.5-4B וארזו מחדש את המודל לטקסט בלבד כדי לחסוך משאבים ולהתמקד בסוכנים.

האם אפשר להריץ אותו עם כל חלון ההקשר של 262 אלף טוקנים על מחשב ביתי?

המשקלים עצמם ייכנסו לכרטיס של 12 או 16 גיגה-בייט, אבל הקשר ארוך של מאות אלפי טוקנים דורש כמות עצומה של זיכרון למטמון. כדי לנצל את כל האורך תצטרכו כרטיסי שרת עם עשרות גיגות זיכרון.

איך מריצים

המשקלים תופסים כ־7.9 גיגה-בייט בפורמט BF16, כך שכרטיס מסך בודד עם 12 עד 16 גיגה זיכרון יחזיק אותו בקלות עם זיכרון קצר. לעומת זאת, אם תנסו לנצל את מלוא חלון ההקשר העצום שלו, דרישות הזיכרון למטמון יזנקו ותצטרכו חומרה חזקה בהרבה או קיטום אגרסיבי של ההקשר.

המפתחים מדגימים הרצה באמצעות SGLang גרסה 0.5.17 או vLLM עם פרסרים ייעודיים של qwen3 לחשיבה ו־qwen3_coder לכלים. כדאי להריץ אותו עצמאית רק אם אתם צריכים סביבה סגורה ללא רשת או אוטומציה מקומית של קוד, אחרת שימוש במודלים גדולים דרך שירות ענן חיצוני ייתן ביצועים אמינים בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TokenRhythm/NeoHorse-1-4B")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המוכר. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו במוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ועותק של הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗