GPT
L

unsloth/Laguna-S-2.1-GGUF

קוד פתוח

unslothopenmdw-1.12026-07-21

  • transformers
  • gguf
  • laguna-s-2.1
  • unsloth
  • vllm

ארכיטקטורת תערובת מומחים לתכנות אוטונומי שמפעילה רק 8 מיליארד פרמטרים מתוך 118 בכל שלב. הוא מציע חלון הקשר של מיליון טוקנים ומיועד להרצה מקומית בקוונטיזציה.

  • 1.6 TBמשקל הקבצים
  • 29,015הורדות בחודש
  • 308לייקים

מה זה

מדובר במודל MoE עם 256 מומחים ועוד מומחה אחד משותף, שמתוכם 10 נבחרים לכל טוקן. המבנה הזה מחלק 48 שכבות ביחס של רבע קשב גלובלי ושלושה רבעים בחלון הזזה של 512 טוקנים, מה שמאפשר לו לעבד הקשר של עד מיליון טוקנים בלי לחנוק את החומרה לחלוטין. הוא נבנה מראש לעבודה בסוכני פיתוח, עם תמיכה מובנית בחשיבה וחיוג כלים שלב אחר שלב.

במבחני SWE-bench Multilingual הוא הגיע ל־78.5% וב־Terminal-Bench 2.1 ל־70.2%. התוצאות האלו עוקפות מודלים גדולים בהרבה כמו Tencent Hy3 ו־Inkling, מה שמראה שהיעילות של המומחים עובדת היטב בפקודות מסוף ובפתרון תקלות קוד אמיתיות, אם כי הוא עדיין מפגר מאחורי מודלי ענק כמו Kimi K3 או Claude Fable 5.

מתאים ל

  • סוכני פיתוח ותיקון באגים

    שילוב חשיבה בין קריאות לכלים ומעבר מבחני SWE-bench בהצלחה גבוהה ביחס למודלים מופעלים בגודל 8B.

  • עבודה מול מאגרי קוד ענקיים

    חלון הקשר של 1,048,576 טוקנים שמאפשר לטעון פרויקטים שלמים לקונטקסט בלי קיטום מוקדם.

  • אוטומציית פקודות מסוף

    תוצאה של 70.2% ב־Terminal-Bench 2.1 מוכיחה יכולת טובה במיוחד בהרצת פקודות shell מדויקות.

איפה זה נופל

בבדיקת DeepSWE המודל צנח ל־40.4%, ובשאלות על בסיסי קוד ב־SWE Atlas הוא נעצר על 46.2%, הרבה מתחת למודלים המובילים. בנוסף, מנגנון החשיבה שלו תלוי באופן קריטי בשימור היסטוריית החשיבה הקודמת. אם המערכת שלכם תשמיט את הבלוקים של reasoning_content בין קריאות לכלים, המודל עלול פשוט להפסיק לחשוב בהמשך הריצה ולחרב משימות מורכבות.

שאלות
נפוצות

איזו גרסה של llama.cpp נחוצה כדי להריץ את הקבצים?

התמיכה בארכיטקטורת Laguna מתחילה מגרסה b10087 של llama.cpp. גרסאות ישנות יותר לא יזהו את מבנה המודל והרצת השרת תיכשל.

האם אפשר להשתמש במודל לפיתוח מוצר מסחרי?

כן, רישיון openmdw-1.1 מאפשר במפורש שימוש ושינוי לצרכים מסחריים. תצטרכו רק לציית למדיניות השימוש של החברה ולא לעקוף מנגנוני בטיחות בלי תחליף ראוי.

איך מונעים ממנו להפסיק לחשוב באמצע תהליך עבודה?

חובה להגדיר enable_thinking בבקשות ולשמור את מקטעי ה־reasoning_content בהיסטוריית ההודעות. השמטה של תוכן החשיבה בין קריאות לכלים תגרום לו לדלג על שלבי תכנון בהמשך.

איך מריצים

קובצי ה־GGUF ששוקלים כ־40 ג'יגה בגרסת ה־UD-Q4_K_XL מחולקים לשלושה חלקים, ודורשים שרת עם זיכרון RAM או VRAM מספק כדי לאכלס אותם לצד טעינת ההקשר. להרצה צריך גרסת llama.cpp ממספר b10087 ומעלה או את הפורק של poolside, וטוענים רק את הקובץ הראשון כשהשאר נטענים לבד.

אם אין לכם כרטיסי מסך חזקים או שאתם לא רוצים להתעסק עם חלוקת קבצים בנפח כזה, יש גישה פשוטה דרך OpenRouter או Vercel AI Gateway. זה עדיף בהרבה על הרצה מקומית אם כל מה שאתם צריכים זה לבדוק כמה קריאות לסוכן קוד בלי להחזיק תשתית פעילה.

ollama run hf.co/unsloth/Laguna-S-2.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

63 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא openmdw-1.1, והוא מתיר שימוש חופשי ושינויים בקוד ובמשקלים לצרכים מסחריים ופרטיים כאחד. עם זאת, השימוש כפוף למדיניות השימוש של poolside ומחייב שמירה על אמצעי הגנה הולמים אם עוקפים את מנגנוני הבטיחות המובנים.

הרישיון המלא בעמוד המודל ↗