GPT
L

Laguna-XS.2

קוד פתוח

poolsideapache-2.02026-04-23

  • transformers
  • safetensors
  • laguna
  • text-generation
  • laguna-xs.2

מודל קוד מבוסס תערובת מומחים שמפעיל רק 3B פרמטרים מתוך 33B. הוא נבנה לסוכני פיתוח אוטונומיים עם חשיבה מובנית וחלון הקשר ענק, ומתוכנן לרוץ גם על מחשב מקומי.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 62.3 GBמשקל הקבצים
  • 29,451הורדות בחודש

מה זה

מדובר במודל MoE שכולל 256 מומחים עם מומחה אחד משותף, כאשר בכל טוקן מופעלים בפועל רק 3B פרמטרים. המבנה הזה מקנה לו זמני תגובה של מודל קטן עם בסיס ידע של רשת גדולה יותר. כדי לטפל בחלון הקשר של 262,144 טוקנים בלי לחנוק את הזיכרון, הוא משתמש בשילוב של מנגנון קשב מקומי מסוג Sliding Window בשלושים שכבות, ומנגנון קשב גלובלי בעשר השכבות הנותרות.

המטרה העיקרית שלו היא עבודת סוכנים אוטונומית, כולל שילוב של בלוקי חשיבה פנימיים לפני קריאות לכלים וביניהן. בבנצ'מרק של SWE-bench Verified הוא הגיע לציון של 69.9%, תוצאה שעוקפת מודלים כמו Devstral Small 2 ומתקרבת ל־Qwen3.5 באותו סדר גודל, אם כי במשימות רב־לשוניות ובסביבות טרמינל מורכבות הוא מציג מספרים נמוכים יותר.

מתאים ל

  • סוכן תיקון באגים עצמאי

    שילוב בלוקי חשיבה בין קריאות לכלים מאפשר לו לתכנן ולפתור תקלות קוד מורכבות במאגרים גדולים.

  • עוזר פיתוח מקומי במחשב אישי

    הפעלה של 3B פרמטרים מאפשרת הרצה מקומית על מחשבי מק עם זיכרון של 36GB ללא שליחת קוד החוצה.

  • אוטומציה בסביבות עריכה

    חיבור לפרוטוקול ACP ולעורכים כמו Zed מאפשר לייצר השלמות ותיקונים ישירות מתוך סביבת העבודה.

איפה זה נופל

המודל מציג פערים מורגשים ברגע שיוצאים מסביבת פיתוח סטנדרטית. ב־Terminal-Bench 2.0 הוא הגיע לציון של 35.7% בלבד, שזה נמוך משמעותית ממודלים כמו Qwen3.6 או GPT-5.4 Nano. גם ב־SWE-bench Multilingual הציון שלו יורד ל־57.7%, מה שמצביע על ביצועים פחות יציבים בשפות שאינן אנגלית. בנוסף, מי שרוצה להריץ אותו דרך TRT-LLM יגלה שנדרשת בנייה ידנית של ענף ספציפי והרצת סקריפט התאמה בגלל תלויות גרסה של transformers.

שאלות
נפוצות

איך אפשר לשלוט על מנגנון החשיבה של המודל כדי לחסוך טוקנים?

אפשר לכבות את תהליך החשיבה בכל קריאה על ידי העברת הפרמטר enable_thinking שמוגדר כ־False בתבנית הצ'אט. בעבודה כסוכן פיתוח היוצרים ממליצים להשאיר את המנגנון פעיל ולשמור את היסטוריית החשיבה בין הפניות.

האם כדאי להריץ אותו מקומית או להשתמש ב־API?

אם אין לכם מחשב ייעודי עם מספיק זיכרון לגרסאות הדחוסות, עדיף להתחיל ב־API שמוצע כרגע בחינם דרך הפלטפורמה שלהם או דרך OpenRouter, במיוחד כדי לוודא שאיכות הפלט מתאימה לקוד שלכם.

איך מריצים

במשקל מלא של bfloat16 הקבצים תופסים 62.3 ג'יגה־בייט, כך שצריך כרטיס מקצועי עם זיכרון משמעותי כדי לטעון אותו ללא דחיסה. עם זאת, היוצרים מציינים שהארכיטקטורה מאפשרת הרצה על מחשבי מק עם 36GB זיכרון מאוחד באמצעות Ollama או ספריות מותאמות כמו MLX, לצד גרסאות קוונטיזציה של FP8 ו־NVFP4.

הוא נתמך ישירות ב־vLLM מגרסה 0.21 ומעלה, ב־Transformers v5.7 ומעלה, וב־SGLang. יש לו גם מודל עזר קטן לטובת Speculative Decoding שמאיץ את תהליך ההסקה. אם אתם רק רוצים לבדוק את ההתאגדות שלו לעבודה עם עורכי קוד כמו Zed או JetBrains, poolside מציעים כלי CLI בשם pool שמתחבר ישירות ל־API החינמי שלהם לזמן מוגבל.

from transformers import pipeline

pipe = pipeline("text-generation", model="poolside/Laguna-XS.2")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, הפצה, שינוי ושילוב במוצרים סגורים ללא תשלום תמלוגים. עם זאת, היוצרים מציינים שהשימוש כפוף גם למדיניות השימוש ההוגן שלהם, וממליצים שלא לעקוף את מנגנוני הבטיחות המובנים ללא מענה חלופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗