GPT
L

Laguna-S-2.1-NVFP4

קוד פתוח

poolsideopenmdw-1.12026-07-02

  • vllm
  • safetensors
  • laguna
  • laguna-s-2.1
  • text-generation

מודל קוד וסוכנים עם 118 מיליארד פרמטרים שרץ בתצורת תערובת מומחים. הוא מיועד למי שרוצה חלון עבודה ענק וחשיבה מובנית, אבל צריך להריץ את הכל על חומרה מקומית.

  • 118Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 92.9 GBמשקל הקבצים
  • 414,298הורדות בחודש

מה זה

מדובר במודל MoE עם 256 מומחים שמפעיל בפועל רק 8.5 מיליארד פרמטרים לכל טוקן. המבנה הזה נבנה עבור משימות תכנות ארוכות, והוא משלב שכבות קשב מקומי וגלובלי ביחס של שלוש לאחת כדי לחסוך זיכרון בזיכרון המטמון. יש לו תמיכה מובנית בחשיבה משולבת בין קריאות לכלים, ואפשר להדליק או לכבות את מנגנון ההיגיון בכל בקשה בנפרד.

במבחני ביצועים לפיתוח תוכנה הוא עומד על 70.2% ב־Terminal-Bench ו־78.5% ב־SWE-bench רב-לשוני, תוצאות שעוקפות מודלים פתוחים כבדים ממנו בהרבה. עם זאת, במבחני תכנות מורכבים יותר כמו SWE-Bench Pro הוא נעצר ב־59.4%, הרחק מאחורי ענקי ענן סגורים כמו Claude Fable שמגיעים ל־80.3%. הוא נותן פתרון חזק מאוד למכונה מקומית, אך עדיין מתקשה מול המודלים המסחריים הגדולים.

מתאים ל

  • סוכן תכנות מקומי

    פועל ישירות בתוך סביבת הפיתוח עם יכולת קריאה לכלים וחשיבה מובנית, בלי להוציא קוד החוצה.

  • ניתוח בסיס קוד בינוני

    מתמודד היטב עם שאלות על מבנה פרויקט בזכות שילוב שכבות הקשב וחלון של 256 אלף טוקנים.

  • אוטומציה בטרמינל

    מציג ציון של 70.2% במבחני פקודות מערכת, ומתאים לביצוע משימות פיתוח מרובות שלבים.

איפה זה נופל

המודל מגיע מוגדר לחלון הקשר של מיליון טוקנים, אך היוצרים מציינים במפורש שיש ירידה באיכות הפלט בהקשרים ארוכים כאלה, ולכן עדיף להגביל אותו ל־256 אלף. בנוסף, גרסת ה־NVFP4 אינה רצה בצורה תקינה על SGLang, וההפעלה ב־vLLM עם מודל הטיוטה רגישה מאוד: חובה להגביל את מספר הרצפים המקבילים ל־32 כדי למנוע קריסה, ואסור לשנות את הגדרות הדגימה המקוריות כמו הוספת min_p שמחזירה שגיאות שרת.

סכנה טכנית נוספת מתרחשת בעלייה הראשונה של השרת. הידור הקרנלים עלול לצרוך את כל זיכרון המערכת ולהפיל את המחשב אם לא מגבילים את מספר התהליכים במפורש לארבעה.

שאלות
נפוצות

האם כדאי להשאיר את חלון ההקשר על מיליון טוקנים?

עדיף שלא. אף על פי שהמודל אומן לגודל הזה, יש ירידה באיכות התשובות בהקשר מלא, והיוצרים עצמם מציעים להגביל את ההגדרה בקובץ הקונפיגורציה ל־256 אלף טוקנים לביצועים יציבים.

האם אפשר להריץ אותו על מחשב פיתוח רגיל?

לא. המשקלים לבדם דורשים מעל 70 גיגה, וכדי לטעון אותם יחד עם זיכרון ההקשר חייבים לפחות 128 גיגה זיכרון אחוד. ללא חומרה ייעודית כזו תיתקלו בחוסר זיכרון מיד עם הטעינה.

איך מריצים

כדי להריץ אותו עצמאית נדרשת תחנת עבודה עם לפחות 128 גיגה זיכרון אחוד, כמו Mac Studio או מחשב ייעודי עם מעבד גרפי מתאים. משקלי ה־NVFP4 שוקלים בערך 71 גיגה, וב־vLLM אפשר להריץ אותו עם פענוח ספקולטיבי שמביא את מהירות הפליטה לכ־24 טוקנים לשנייה בקוד. מי שמשתמש ב־Ollama יקבל קובץ GGUF של 75 גיגה, שרץ בקצב של 12 עד 17 טוקנים לשנייה.

אם אין לכם חומרה כזו עם 128 גיגה זיכרון לפחות, אין טעם לנסות להרים אותו מקומית. במצב כזה עדיף לגשת ישירות ל־API דרך שירותים כמו OpenRouter או Vercel AI Gateway, במקום לקנות חומרה יקרה.

pip install -U huggingface_hub
hf download poolside/Laguna-S-2.1-NVFP4

הקבצים

61 קבצים במאגר, 92.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא openmdw-1.1, והוא מאפשר שימוש חופשי ושינוי של המודל למטרות מסחריות ופרטיות כאחד. מי שרוצה להטמיע אותו במוצר מסחרי יכול לעשות זאת, אך השימוש כפוף למדיניות השימוש ההוגן של poolside שמחייבת שמירה על מגבלות בטיחות.

הרישיון המלא בעמוד המודל ↗