GPT
L

Laguna-S-2.1

קוד פתוח

poolsideopenmdw-1.12026-07-13

  • transformers
  • safetensors
  • laguna
  • text-generation
  • laguna-s-2.1

מודל קוד עם ארכיטקטורת מומחים שמפעיל שמונה מיליארד פרמטרים מתוך מאה ושמונה עשר. הוא נועד למשימות פיתוח ממושכות שדורשות שילוב של הרצת כלים עם חשיבה מובנית.

  • 118Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 219 GBמשקל הקבצים
  • 44,657הורדות בחודש

מה זה

מדובר במודל שמכוון ישירות לעבודה של סוכני תוכנה ופתרון בעיות בקוד. הוא מבוסס על מאתיים חמישים ושישה מומחים מנותבים ועוד מומחה משותף אחד, כשבכל שלב רק עשרה מנותבים פעילים. המבנה הזה נותן לו לרוץ מהר יחסית לגודל מלא, תוך שילוב של שכבות תשומת לב גלובליות ושכבות חלון נע קצר של 512 טוקנים כדי להחזיק הקשר של מיליון טוקנים.

במבחני ביצועים הוא מציג תוצאות מעניינות. בבדיקות כמו SWE-bench Multilingual הוא מגיע ל־78.5% ועוקף מודלים ענקיים ממנו בהרבה, וב־Terminal-Bench הוא עומד על 70.2%. מצד שני, במבחני תכנות מורכבים במיוחד כמו DeepSWE הוא משיג 40.4%, רחוק מאוד ממודלים קנייניים כבדים כמו Claude Fable 5 שמגרדים את ה־70%.

מתאים ל

  • סוכני פיתוח אוטונומיים

    הוא מתוכנן לעצור, לחשוב, להפעיל כלי מערכת ולתקן קוד על בסיס התוצאה.

  • ניתוח לוגים ומסדי קוד ענקיים

    חלון הקשר של מיליון טוקנים מאפשר לקרוא ספריות שלמות ברצף אחד.

  • עבודה מקומית ללא ענן

    רישיון חופשי ומגוון גרסאות קוונטיזציה מאפשרים אירוח עצמי בסביבות מאובטחות.

איפה זה נופל

המודל הזה בנוי אך ורק לטקסט ולמשימות תוכנה, ולא יודע לעבד תמונות. נקודת התורפה המשמעותית שלו היא התלות הקריטית ברצף החשיבה הפנימי, מה שהיוצרים מכנים preserved thinking. אם אתם בונים מערכת סוכנים ומסננים מההיסטוריה את מחשבות הביניים של המודל בין קריאות לכלים, הוא פשוט מפסיק לחשוב בהמשך הדרך ורמת הקוד שלו מתרסקת. בנוסף, בפתרון שאלות הבנה מעמיקות על מאגרי קוד הוא מגיע רק ל־46.2% במבחן SWE Atlas, כך שהוא עדיין מתקשה לנווט בפרויקטים סבוכים.

אותה משפחה

Laguna-S-2.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לכבות את מנגנון החשיבה המובנה כדי לחסוך זמן וטוקנים?

אפשר לכבות אותו בהגדרות הקריאה באמצעות הפרמטר enable_thinking, אבל במשימות פיתוח מורכבות זה פוגע ישירות ביכולת של המודל לחבר בין שלבי הקוד ולדייק בתוצאה.

האם אפשר להריץ אותו על שרת יחיד עם כרטיס מסך רגיל?

לא בגרסה המקורית שדורשת מאות גיגהבייט זיכרון גרפי. בשביל כרטיס בודד תצטרכו להשתמש בגרסאות מכוילות ודחוסות מאוד כמו GGUF או NVFP4 דרך llama.cpp או Ollama.

איך מריצים

המשקל המקורי בפורמט bfloat16 שוקל כ־219 גיגהבייט ודורש שרתי שרת מרובי כרטיסי מסך, למשל ארבעה כרטיסים עם הגדרת tensor parallel מתאימה ב־vLLM או SGLang. הוא תומך גם ב־TRT-LLM, ויש לו גרסת llama.cpp ייעודית שתומכת במודל טיוטה בשם DFlash להאצת הזמנים.

אם אתם רוצים לנסות אותו מקומית על חומרה צנועה יותר, יש קבצי כיול ודחיסה כמו FP8, NVFP4 או GGUF, ואפשר למשוך אותו גם ישירות מ־Ollama. עם זאת, אם אין לכם אשכול שרתים ייעודי שפועל מסביב לשעון, החזקה עצמית של מפלצת כזו תעלה הון, וזול בהרבה לפנות אליו דרך OpenRouter או Vercel AI Gateway.

from transformers import pipeline

pipe = pipeline("text-generation", model="poolside/Laguna-S-2.1")
print(pipe("שלום"))

הקבצים

61 קבצים במאגר, 219 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא openmdw-1.1, והוא מתיר שימוש מסחרי מלא ושינוי של המשקלים בלי לבקש רשות מאף אחד. אם אתם מתכוונים להטמיע אותו במוצר שלכם, אתם חופשיים לעשות את זה, כל עוד השימוש תואם למדיניות השימוש של החברה ושומר על מנגנוני הבטיחות הנדרשים.

הרישיון המלא בעמוד המודל ↗