GPT
N

Nanbeige4.2-3B

קוד פתוח

Nanbeigeapache-2.02026-07-21

  • transformers
  • safetensors
  • nanbeige
  • text-generation
  • llm

מודל שפה קומפקטי שמכוון לפעולות סוכן וכתיבת קוד במשאבים צנועים. הוא מציג יכולת הסקת מסקנות שמקדימה מודלים כבדים ממנו בהרבה.

  • 4.2Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.8 GBמשקל הקבצים
  • 33,231הורדות בחודש

מה זה

בבסיס שלו יושבת ארכיטקטורת Looped Transformer שמריצה שכבות שוב ושוב וכך מגדילה את יכולת העיבוד בלי לנפח את כמות הפרמטרים. יש לו רק 3 מיליארד פרמטרים שאינם שכבות הטמעה, אבל הוא בנוי להריץ לולאות חשיבה עצמאיות, להפעיל כלים חיצוניים ולטפל במשימות ארוכות טווח דרך מעטפות סוכנים כמו OpenClaw.

במדדי ביצועים של פיתוח תוכנה וסוכני משרד, התוצאות מראות יתרון ברור על פני מתחרים. במבחן SWE-Bench Verified הוא רשם 63.6 נקודות, ובמבחן ההיגיון המתמטי GPQA-Diamond קיבל 87.4 נקודות. הציונים האלה עוקפים מתחרים ישירים כמו Qwen3.5-9B ו־Gemma4-12B, ומראים שמיקוד נכון באימון מבוסס סביבות מגוונות שווה יותר מסתם משקל גולמי.

מתאים ל

  • סוכן מקומי לתיקון באגים

    התוצאה ב־SWE-Bench עוקפת מודלים כבדים, וקל להריץ אותו מקומית על תחנת פיתוח בלי לחשוף קוד רגיש לרשת.

  • עוזר מחקר אישי במחשב

    הוא נבנה לעבוד עם סביבות סוכן וכלים חיצוניים כדי לסרוק מסמכים ארוכים ולבצע בדיקות רב שלביות.

  • הפעלת כלים במערכות קצה

    תבנית ה־XML המובנית לקריאת פונקציות מאפשרת להפעיל תסריטי אוטומציה מורכבים במכשירים עם משאבי זיכרון מוגבלים.

איפה זה נופל

המפתחים מודים שהפלט עלול להכיל מידע שגוי, הטיות או תוכן מזיק עקב האופי ההסתברותי של המודל. מעבר לכך, הוא מאומן רק על אנגלית וסינית, כך שאינו מתאים לעבודה בעברית. הציונים שלו במבחני ישור כמו IF-Bench ו־Recruit-Bench נמוכים יותר לעומת חלק מהמתחרים, מה שאומר שהוא מתקשה יותר להישמע להוראות עיצוב נוקשות. בנוסף, חלון ההקשר הענקי עשוי להאט מאוד את המענה כשמנצלים אותו עד הקצה על חומרה חלשה.

אותה משפחה

Nanbeige4.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישר דרך Ollama הרגיל שהתקנתי במחשב?

לא באופן ישיר. המודל דורש ענף מיוחד של פרויקט Ollama שכולל מפענח ייעודי לארכיטקטורה הזו, ולכן תצטרכו להוריד את הקוד מהמאגר שלהם ולקמפל את התוכנה לבד.

איך כדאי להגדיר את שיחות הצ'אט כדי לקבל תוצאות כמו במבחנים?

הכרטיס ממליץ להשאיר את מנגנון החשיבה דולק, להשתמש בתבנית XML עבור כלים, ולהגדיר טמפרטורה של 1.0 למשימות סוכן או 0.6 למענה על שאלות וחישובי היגיון.

איך מריצים

במשקל של 7.8 ג'יגה בייט בפורמט המקורי, כרטיס גרפי ביתי יחיד עם 8 עד 12 ג'יגה זיכרון יספיק לחלוטין כדי לטעון אותו, ואחרי קוונטיזציה ל־Q4 אפשר להריץ אותו בנוחות גם על מעבדי אפל ומחשבים ניידים פשוטים. ההרצה דורשת transformers 4.45.1 ומחייבת להפעיל קוד מרוחק בגלל הארכיטקטורה הייחודית.

מי שרוצה ביצועים מהירים בעבודה עם סוכנים יצטרך לקמפל גרסאות ייעודיות של vLLM, SGLang או llama.cpp מענף ייעודי שהמפתחים פרסמו, כי התמיכה בארכיטקטורה הזו טרם נכנסה לענפים הראשיים. אם אין לכם עניין להתעסק בבניית תוכנה מקומית מקוד מקור, עדיף לחכות שספקי שרתים יוסיפו אותו כשירות ענן מסודר.

from transformers import pipeline

pipe = pipeline("text-generation", model="Nanbeige/Nanbeige4.2-3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 המוכר, שמאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי מלא, שינוי קוד והפצה. התנאי היחיד הוא שמירת הודעות זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה, כך שאין מניעה לשלב אותו במוצרים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗