GPT
L

Laguna-XS-2.1

קוד פתוח

poolsideopenmdw-1.12026-06-20

  • transformers
  • safetensors
  • laguna
  • text-generation
  • laguna-xs-2.1

מודל קוד של 33 מיליארד פרמטרים שמשפעל בפועל רק 3 מיליארד פרמטרים לטוקן. הוא נבנה לסוכני תכנות שרצים מקומית ומשלב חשיבה מובנית בין קריאות לכלים.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 62.3 GBמשקל הקבצים
  • 38,811הורדות בחודש

מה זה

במקום לשפעל את כל 33 מיליארד הפרמטרים בכל צעד, הארכיטקטורה כאן מבוססת על 256 מומחים ועוד מומחה אחד משותף, כך שבכל רגע נתון רק 3 מיליארד פרמטרים פעילים. השילוב הזה נותן מהירות ריצה גבוהה בהרבה ממודלים צפופים בגודל דומה. תשומת הלב מחולקת בין שכבות גלובליות לשכבות של חלון נע ביחס של אחת לשלוש לאורך 40 שכבות, וזיכרון הקי־וליו מכווץ לפורמט FP8 כדי לחסוך מקום בחלון הקשר המלא של 262,144 טוקנים.

במבחני התכנות הוא מכוון ישירות לעבודה מול סביבות פיתוח ומסופים. במבחן SWE-bench Verified הוא עומד על 70.9% ועל 63.1% בגרסה הרב־לשונית שלו. עם זאת, במשימות מסוף מורכבות יותר כמו Terminal-Bench 2.0 הוא מגיע ל־37.5%, תוצאה שנמוכה משמעותית ממודלים כמו Qwen3.6-35B-A3B שעומד שם על 51.5%. הוא יודע לעצור, לחשוב לפני הפעלת כלי ולהמשיך לחשוב על בסיס הפלט שחזר מהכלי.

מתאים ל

  • סוכן תכנות בעורך הקוד

    התממשקות ישירה ל־Zed או JetBrains דרך פרוטוקול ACP לביצוע משימות קוד ופקודות מסוף.

  • ניתוח בסיס קוד גדול מקומית

    חלון הקשר של 262 אלף טוקנים שמאפשר לטעון פרויקטים שלמים במחשב פיתוח עם כרטיס מתאים.

  • הפעלת כלים רב־שלבית

    יכולת מובנית לחשיבה מתמשכת בין קריאות לפונקציות וקבלת החלטות לפני הרצת פקודות.

איפה זה נופל

למרות שהוא מוגדר כמתאים למחשב מקומי, משתמשי מק עלולים להיתקל בפלט ריק לחלוטין בהרצה דרך Ollama בגלל באג של גלישת זיכרון ב־Metal, בעיה שתלויה בתיקון שטרם נסגר ב־llama.cpp. ב־vLLM גרסאות ישנות מפילות בשקט קריאות לכלים אם אין שורת רווח אחרי שם הפונקציה, והטקסט הגולמי של הקריאה דולף לתשובה. בנוסף, המודל תלוי בשימור של בלוקי החשיבה הקודמים בהיסטוריית השיחה. אם תנקו את שלבי ה־thinking בין פניות, הוא יפסיק להפיק חשיבה בצעדים הבאים, מה שפוגע ביכולת שלו כסוכן עצמאי.

אותה משפחה

Laguna-XS-2.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד לי על MacBook Pro עם מעבד אפל סיליקון?

הוא יכול לעבוד בגרסת Q4 על מכונות עם לפחות 36GB זיכרון, אך נכון לעכשיו קיימת בעיית תוכנה מוכרת ב־Metal שגורמת לו להחזיר פלט ריק בהרצה מקומית. עד שייכנס התיקון הרשמי בספריית llama.cpp, תצטרכו להשתמש במכונת לינוקס עם כרטיס של אנבידיה או לעבוד דרך ה־API.

איך מבטלים את שלב החשיבה הארוך אם אני צריך רק תשובה מהירה?

בזמן הפנייה לשרת אפשר להעביר את הפרמטר enable_thinking שמוגדר כ־False בתוך תבנית הצ׳אט. המודל פשוט ידלג על בלוק ה־think ויחזיר מיד את קטע הקוד או המענה שביקשתם.

איך מריצים

המשקל המלא של המשקולות בדיוק bfloat16 מגיע ל־62.3 ג׳יגה־בייט הפרוסים על פני 29 קבצים, מה שדורש לפחות שני כרטיסי 48GB כדי לרוץ בצורה גולמית. מנגד, קיימות גרסאות מכווצות בפורמטים של FP8, NVFP4 ו־INT4, וכן קובצי GGUF שמאפשרים להריץ את המודל דרך Ollama או llama.cpp אפילו על מחשב מק עם 36GB זיכרון אחוד. שרתי הסקה כמו vLLM, SGLang ו־TensorRT-LLM תומכים בו ישירות, כולל אפשרות לחיבור מודל דיוג קטן מסוג DFlash לשיפור המהירות.

אם סביבת העבודה שלכם היא שרת ייעודי או מכונת פיתוח עם כרטיסי אנבידיה מודרניים, הרצה עצמאית דרך vLLM נותנת שליטה מלאה על הפרטיות והכלים. לעומת זאת, אם אתם עובדים על מחשב נייד רגיל וזקוקים לכל 262 אלף הטוקנים של ההקשר ברמת דיוק מלאה, תעדיפו לפנות לנקודת הקצה הפתוחה ב־OpenRouter, שבה פולסייד מציעה הסקה לתקופת השקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="poolside/Laguna-XS-2.1")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון openmdw-1.1, שהוא רישיון מתירני לחלוטין. מותר להשתמש בו, לשנות את המשקולות ולבנות עליו מוצרים מסחריים בלי לבקש אישור מראש. עם זאת, השימוש כפוף למדיניות השימוש ההוגן של החברה, והחברה מציעה הסכמי שיפוי משפטי ותמיכה רק במסלול עסקי נפרד.

הרישיון המלא בעמוד המודל ↗