GPT
B

Bonsai-27B-gguf

קוד פתוח

prism-mlapache-2.02026-07-04

  • llama.cpp
  • gguf
  • conversational
  • 1-bit
  • llama-cpp

מודל שפה של 27 מיליארד פרמטרים שמכווץ למשקל של 3.9 גיגה בייט בלבד. הוא פונה למי שחייב להריץ מודל חשיבה כבד מקומית על מחשב נייד רגיל בלי לשלם על כרטיסי שרת.

  • 63.6 GBמשקל הקבצים
  • 458,133הורדות בחודש
  • 846לייקים

מה זה

המודל הזה מבוסס על הארכיטקטורה של Qwen3.6-27B, אבל המשקלים שלו עברו המרה בינארית מלאה לרמה של 1.125 ביט למשקל בפורמט ייעודי של llama.cpp. בניגוד לכימות אגרסיבי רגיל שבו מודלים קורסים לחלוטין, כאן הוא שומר על כמעט תשעים אחוזים מביצועי הדיוק של גרסת המקור הלא מכווצת.

המשמעות בפועל נראית במבחני חשיבה מורכבים. במתמטיקה הוא מחזיק ציון של 91.66 נקודות מול 95.33 במקור, ובקוד הוא עומד על 81.88 נקודות. ההבדל הגדול בינו לבין מודלים אחרים בגודל דומה הוא השילוב בין צריכת זיכרון מזערית לבין שמירה על יכולות פתרון בעיות, לצד ארכיטקטורת קשב היברידית שחוסכת מקום בזיכרון של רצף השיחה.

מתאים ל

  • עבודה מול מאגרי קוד מקומיים

    מאפשר ניתוח קוד מקומי שלם בתוך חלון הקשר ענק ישירות על לפטופ פיתוח רגיל.

  • ניתוח מסמכים רגישים לחלוטין

    עיבוד טקסטים ארוכים על מכשיר מבודד מהרשת בלי להוציא מידע לשרתי צד שלישי.

  • סביבות קצה בעלות זיכרון נמוך

    הרצה מקומית על חומרת צרכנים צנועה שאינה מסוגלת לטעון מודלים רגילים של 27B.

איפה זה נופל

המחיר של כימות לביט בודד מורגש בירידה חדה במשימות מסוימות. עמידה בהוראות מורכבות נפלה מציון של 78.47 לציון 65.74, וביצועי סוכנים וקריאה לפונקציות ירדו משמונים נקודות לשישים ושש. המפתחים מציינים במפורש שהוא לא מתאים עדיין לעבודות תכנות של סוכנים אוטונומיים שדורשות מעבר בין קבצים ותיקון שגיאות עצמאי. בנוסף, מודל הראייה אינו בינארי ודורש קובץ נוסף.

אותה משפחה

Bonsai יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את הקובץ בגרסה הרשמית של llama.cpp?

לא. חייבים לקמפל את המזלג של Prism ML מהמאגר שלהם בגיטהאב. הגרסה הרגילה לא כוללת את הקרנלים המיוחדים שנדרשים כדי לפענח את פורמט Q1_0_g128.

כמה זיכרון דרוש כדי לנצל את חלון ההקשר המלא?

בשימוש בכיווץ מטמון ל־4 ביט, חלון מלא של 262 אלף טוקנים דורש סביב 9.4 גיגה בייט זיכרון כולל המשקלים. ללא כיווץ, הקשר של מאה אלף טוקנים ייקח 11.6 גיגה בייט.

איך מריצים

כדי להריץ אותו צריך להוריד ולבנות את המזלג הייעודי של llama.cpp שפיתחה Prism ML, כיוון שהוא מכיל את הקרנלים שקוראים את הפורמט הבינארי ישירות בלי לפתוח אותו חזרה בזיכרון. המודל דורש כארבעה גיגה בייט זיכרון למשקלים, ובזכות קשב לינארי הוא מגיע לשיא של 11.6 גיגה בייט בלבד בהקשר של מאה אלף טוקנים בלי כיווץ מטמון.

על מחשבי מק עם שבבי M4 Pro ועד M5 Max הוא מייצר בין 26 לשישים ושישה טוקנים בשנייה. אם אתם על לינוקס עם כרטיס אנבידיה, מודל הטיוטה הנלווה מאפשר האצה של פי 1.37 בפועל. שווה להרים את זה לבד רק אם הפרטיות או היעדר חיבור לרשת קריטיים, כי שרתי ענן מספקים מהירות גבוהה בהרבה במקביל.

ollama run hf.co/prism-ml/Bonsai-27B-gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו במוצרים סגורים, לשנות אותו ולהפיץ אותו חופשי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗