GPT
L

Laguna-XS-2.1-GGUF

קוד פתוח

poolsideopenmdw-1.12026-06-29

  • transformers
  • gguf
  • laguna-xs-2.1
  • llama.cpp
  • text-generation

זה מודל שתוכנן מראש לסוכני פיתוח ומשימות קוד מורכבות על מחשב מקומי. הוא מפעיל רק שלושה מיליארד פרמטרים בכל טוקן, כך שמקבלים ביצועי תכנות חזקים בלי לטחון את החומרה.

  • 81.2 GBמשקל הקבצים
  • 229,322הורדות בחודש
  • 87לייקים

מה זה

מדובר במודל מומחים של שלושים ושלושה מיליארד פרמטרים, שמפעיל בכל רגע נתון רק שלושה מיליארד מתוכם ומחזיק חלון הקשר של 262,144 טוקנים. הוא בנוי לעבודה רציפה מול מסוף, קריאות לכלים והרצת תהליכי חשיבה בין פעולות, עם יכולת להדליק או לכבות את החשיבה לפי צורך בכל פנייה.

השילוב של מנגנון קשב מקומי וגלובלי יחד עם קוונטיזציה של זיכרון ההקשר שומר על צריכת משאבים נמוכה. מול הגרסה הקודמת שלו הוא מציג עלייה של 5.4 אחוזים במבחן SWE-bench Multilingual, מה שאומר בפועל פחות שגיאות בהבנת משימות מורכבות וכתיבת פתרונות תוכנה אמיתיים.

מתאים ל

  • סוכני פיתוח אוטונומיים

    הוא תומך בבניית תהליכי חשיבה משולבים בין קריאות לכלים ופקודות טרמינל מקומיות.

  • בדיקת באגים בקוד רב־לשוני

    הוא מציג שיפור ניכר במבחני תכנות מורכבים ומתאים לאיתור ותיקון תקלות בפרויקטים גדולים.

  • עבודה מול מסוף מקומי

    הארכיטקטורה שלו מותאמת ישירות להרצה של משימות פיתוח איטרטיביות על גבי המחשב שלכם.

איפה זה נופל

התמיכה במודל ב־llama.cpp עדיין לא נכנסה לקוד הרשמי של הפרויקט. נכון לעכשיו צריך להוריד ענף ספציפי מתוך בקשת משיכה פתוחה ולקמפל את הקוד לבד, מה שעלול להישבר בעדכונים הבאים. בנוסף, חלון ההקשר הענקי ידרוש מכם להגביל ידנית את כמות הטוקנים, אחרת הזיכרון המקומי ייגמר מהר מאוד.

אותה משפחה

Laguna-XS-2.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו ישירות דרך הגרסה הרשמית של llama.cpp?

עדיין לא. התמיכה במודל נמצאת כרגע בתוך בקשת משיכה מספר 25165 ולא מוזגת לגרסה הראשית. תצטרכו להוריד את הענף הרלוונטי ולקמפל אותו בעצמכם, או להשתמש במשיכה ישירה דרך Ollama.

למה כדאי להגביל את חלון ההקשר בהרצה מקומית?

המודל תומך עקרונית ביותר ממאתיים וחמישים אלף טוקנים, אבל ניצול מלא כזה יעמיס מאוד על זיכרון המחשב. הגדרה של ערך כמו 32,768 טוקנים שומרת על ביצועים טובים ולא חונקת את הזיכרון המקומי שלכם.

איך מריצים

קובץ ה־Q4_K_M שוקל 20.3 ג'יגה בייט ודורש מחשב עם לפחות 36 ג'יגה בייט זיכרון, כמו מק עם אפל סיליקון, כדי לרוץ בצורה חלקה. גרסת ה־BF16 המלאה שוקלת 66.9 ג'יגה בייט, אבל היא מיועדת בעיקר כבסיס ליצירת המרות וכיולים משלכם ולא לעבודה יומיומית.

אפשר למשוך אותו ישירות דרך Ollama או להרים שרת מקומי עם llama.cpp, תחת הגבלת הקשר סבירה כדי שהזיכרון לא יתנפח. אם אין לכם את החומרה הזו או שאתם לא רוצים להתעסק עם קומפילציה ידנית, המודל זמין גם דרך ה־API של OpenRouter.

ollama run hf.co/poolside/Laguna-XS-2.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 81.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפיתוח מופץ תחת רישיון openmdw-1.1 שמתיר שימוש, שינוי והפצה גם לפרויקטים מסחריים וגם לשימוש פרטי. אין כאן הגבלה על הטמעה במוצר שלכם, אבל אתם מחויבים לפעול לפי מדיניות השימוש ההוגן של poolside ולשמור על מנגנוני הבטיחות.

הרישיון המלא בעמוד המודל ↗