GPT
L

Laguna-S-2.1-GGUF

קוד פתוח

poolsideרישיון לא דווח2026-07-13

  • gguf
  • endpoints_compatible
  • conversational

גרסת קבצים מכווצת של poolside שנועדה להרצה מקומית עם חלון הקשר ענק של 256K ומודל טיוטה להאצה. היא מתאימה למי שחייב לשמור את כל המידע בשרתים שלו ומחזיק חומרה מתאימה.

  • 431 GBמשקל הקבצים
  • 658,407הורדות בחודש
  • 172לייקים

מה זה

הקבצים האלה הם המרה לפורמט GGUF של Laguna S 2.1, שמיועדת להרצה ישירה דרך llama.cpp. poolside שחררו כאן כמה רמות כימות, החל מגרסת הדיוק המלאה ששוקלת 235 גיגה בייט ועד גרסת Q4_K_M של 68 גיגה בייט, שבה מומחי הניתוב מכווצים אבל נתיב הסיגנל המרכזי נשמר ברמת דיוק גבוהה יותר כדי למנוע איבוד יכולות.

הייחוד המרכזי בחבילה הזו הוא שילוב של חלון הקשר עצום שתומך ב־256 אלף טוקנים כברירת מחדל, יחד עם מודל טיוטה קטן בשם DFlash ששוקל 2.2 גיגה בייט. מודל הטיוטה הזה נועד לייצר speculative decoding, שיטה שמאיצה את קצב יצירת הטקסט בלי לפגוע במשקלים של המודל הראשי.

מתאים ל

  • עיבוד מסמכים עצומים

    חלון של 256K טוקנים מתאים לניתוח כמויות גדולות של מידע בבת אחת בלי צורך בחיתוך אגרסיבי של הטקסט.

  • הסקה מהירה בשרת פרטי

    שימוש במודל הטיוטה DFlash מאפשר לייצר טקסט בקצב מהיר משמעותית על חומרה ייעודית בארגון.

  • עבודה ללא תלות בענן

    הרצה פנימית מוחלטת דרך שרת מקומי שומרת על המידע בארגון ולא דורשת חיבור לשירותי צד שלישי.

איפה זה נופל

למרות שהמשקלים אומנו לתמוך בהקשר של מעל מיליון טוקנים, החברה מציינת במפורש שמעבר ל־256K יש ירידה באיכות הפלט. אם דוחפים אותו למיליון טוקנים צריך לשנות הגדרות ידנית ולהסתמך על דגימה ספציפית כדי לנסות לאזן את התוצאות.

בנוסף, הכרטיס לא כולל שום מבחני ביצועים, מדדי השוואה או מידע על יכולות הקוד והשפה של המודל. התמיכה שלו בגרסה הרשמית של llama.cpp עדיין בבדיקה, כך שאתם תלויים במימוש ובתיקונים של poolside עצמם.

אותה משפחה

Laguna-S-2.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב אישי רגיל?

לא. הקובץ המכווץ ביותר שוקל 68 גיגה בייט, וזה רק המשקלים עצמם בלי הזיכרון הדרוש להרצה ולחלון ההקשר. תצטרכו שרת ייעודי עם נפח VRAM משמעותי.

האם כדאי להפעיל אותו עם מיליון טוקנים כפי שמתואר?

היוצרים עצמם ממליצים להישאר בטווח של 256K כדי לקבל פלט איכותי. שימוש בחלון המלא של מיליון טוקנים גורר פגיעה באיכות התשובות ודורש הגדרות ידניות מורכבות.

איך מריצים

כדי להריץ אותו לא תוכלו להשתמש עדיין בגרסה הרשמית הראשית של llama.cpp, אלא צריך לקמפל ענף ייעודי של poolside שתומך בארכיטקטורה ובפיענוח המהיר. אפילו הגרסה המכווצת ביותר, Q4_K_M, דורשת 68 גיגה בייט רק למשקלים, לפני שמחשבים את הזיכרון שנחוץ לחלון הקשר המלא, מה שמחייב שרת עם כמה כרטיסי מסך חזקים.

אם אין לכם קלאסטר מתאים או שאתם לא רוצים לתחזק שרת כזה, poolside מפנים ישירות לשירותים כמו OpenRouter או Vercel AI Gateway. זה עדיף בהרבה למי שרוצה לבדוק התאמה לפרויקט לפני שמתחייבים להקמת תשתית כבדה.

ollama run hf.co/poolside/Laguna-S-2.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של קובצי ה־GGUF, והיוצרים מפנים לכרטיס המודל המקורי כדי לבדוק אותו. מבחינה משפטית, כל עוד הרישיון לא מוגדר בבירור בקבצים שאתם מורידים, אי אפשר לדעת אם מותר להשתמש בו במוצר מסחרי, להפיץ אותו או להטמיע אותו מול לקוחות. יש לוודא את הרישיון המקורי לפני שמשלבים אותו בפיתוח.

הרישיון המלא בעמוד המודל ↗