GPT
N

Nanbeige4.1-3B

קוד פתוח

Nanbeigeapache-2.02026-02-10

  • transformers
  • safetensors
  • llama
  • text-generation
  • llm

מודל פתוח קומפקטי שמכוון לחשיבה רב שלבית והפעלת כלים מורכבת. הוא מביא יכולות חיפוש עמוק ופתרון בעיות שבדרך כלל רואים במודלים כבדים בהרבה.

  • 3.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 17,143הורדות בחודש

מה זה

זהו מודל של 3.9 מיליארד פרמטרים בארכיטקטורת Llama, שעבר אימון נוסף בשיטות SFT וחיזוק בלמידה. הדגש כאן הוא שילוב בין יכולות ניתוח לבין התנהגות סוכן שמסוגל להחזיק תהליכי עבודה ארוכים עם מעל 500 קריאות לכלים חיצוניים.

במדדי קוד וחשיבה הוא עוקף מודלים בגודל דומה ומגיע להישגים מרשימים גם מול שחקנים של 30 מיליארד פרמטרים. לדוגמה, במבחן Live-Code-Bench-V6 הוא מקבל ציון של 76.9 לעומת 57.4 של Qwen3-4B ו־55.7 של גרסת ה־32B שלו. במבחן AIME 2026 I במתמטיקה הוא מציג 87.40, שזה קו ביצועים של מודלים ענקיים.

במשימות סוכן וחיפוש עמוק הוא רושם קפיצה חדה לקטגוריה שלו. במדד GAIA הוא מוציא 69.90 נקודות, רחוק ממתחרים ישירים באותו סדר גודל שמגרדים שם את ה־30. הנתונים מראים שהוא יודע לפרק חיפושים מורכבים ברשת ולהפעיל סביבות ריצה באופן עקבי יחסית למשקלו.

מתאים ל

  • סוכן חיפוש ומחקר אוטונומי

    הוא מיועד להרצת שרשרת חיפושים וגרידת נתונים מרובת שלבים באמצעות כלי רשת וארגז חול.

  • פתרון בעיות קוד מקומי

    מציג ציונים גבוהים במבחני קידוד ומאפשר הרצת תהליכי ניתוח תוכנה על חומרה מקומית צנועה.

  • חישובים מתמטיים מורכבים

    התוצאה שלו במבחן AIME מוכיחה שהוא מסוגל להחזיק שרשראות הסקה מורכבות ללא צורך במודל ענק.

איפה זה נופל

המודל הוכשר אך ורק באנגלית ובסינית, ולכן הוא לא מתאים לעיבוד טקסט בעברית ללא אימון נוסף. היוצרים מציינים במפורש שהגודל הקומפקטי שלו והטבע ההסתברותי גורמים לו לפלוט הטיות, תכנים פוגעניים ותוצאות לא צפויות, בעיקר במצבי קצה. בנוסף, הרצה יעילה של מנגנון החיפוש העמוק שלו דורשת שימוש במודל נפרד לתמצות, למשל Qwen3-14B, מה שמסבך את התשתית.

שאלות
נפוצות

האם המודל מבין ופולט עברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא אומן על עברית, ולכן לא הייתי בונה עליו ליישומים בשפה הזו.

איזה זיכרון נדרש בפועל כדי לעבוד איתו?

המשקלים תופסים 7.3 ג'יגה בייט בזיכרון ה־GPU. כרטיס עם 12 ג'יגה בייט יספיק לשיחה רגילה, אך ניצול של חלון ההקשר המלא ידרוש כרטיס חזק יותר או קוונטיזציה.

האם אפשר להריץ את יכולות החיפוש העמוק רק עם הקוד שלו?

לא. לצורך משימות חיפוש מורכבות הוא נשען על תשתית miroflow, שירות סנדבוקס של E2B, חיבור ל־API של גוגל ומודל תמצות משלים.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.3 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך ביתי בודד עם 12 עד 16 ג'יגה בייט זיכרון מחזיק אותו בקלות. טוענים אותו ישירות דרך ספריית transformers בפייתון עם תמיכה בקוד מרוחק והגדרת טוקנייזר ייעודית.

אם המטרה שלכם היא להשתמש בו לחיפוש עמוק, ההרצה דורשת סביבה חיצונית כמו miroflow-framework וחיבור לשירותי עזר חיצוניים, בהם ארגז חול של E2B ומנוע חיפוש. במקרה שאין לכם צורך בתהליכי סוכן עצמאיים או חומרה מקומית זמינה, מודלים מסחריים מבוססי API עשויים לחסוך את כל ניהול הכלים הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Nanbeige/Nanbeige4.1-3B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש חופשי בקוד ובמשקלים, כולל הפעלה במוצרים מסחריים, שינויים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗