GPT
T

Ternary-Bonsai-27B-gguf

קוד פתוח

prism-mlapache-2.02026-07-04

  • llama.cpp
  • gguf
  • conversational
  • ternary
  • 2-bit

גרסה מכווצת של Qwen3.6-27B בייצוג טרנרי שדורשת רק 7.2 גיגה זיכרון. מודל למי שרוצה יכולות חשיבה ומתמטיקה של 27B ישירות על מחשב נייד בלי לקרוס בביצועים.

  • 80.6 GBמשקל הקבצים
  • 639,055הורדות בחודש
  • 1,304לייקים

מה זה

במקום קוונטיזציה רגילה של 2 ביט ששוברת מודלים במשימות מורכבות, כאן המשקולות מקבלות ערכים של מינוס אחד, אפס או פלוס אחד, עם סקייל של 16 ביט לכל קבוצה של 128 ערכים. השיטה הזו שומרת על 94.6% מהיכולת המקורית של המודל המלא, כשהיא מחזיקה ציון של 80.49 במבחני חשיבה מול 85.07 במקור.

ההבדל המהותי מורגש איפה ששיטות אחרות נכשלות לגמרי. במבחן AIME26 המודל מוציא 87.5 בעוד גרסת IQ2_XXS צונחת ל־57.5, ובמתמטיקה כללית הוא עומד על 93.4 מול 95.33 במקור. בנוסף, הארכיטקטורה מבוססת על 75% תשומת לב ליניארית, מה שמאפשר להריץ הקשר של 262 אלף טוקנים בלי לחנוק את הזיכרון של המכשיר.

מתאים ל

  • סוכן מקומי במחשב נייד

    מריץ חשיבה ברמת 27B ושימוש בכלים בקצב של כ־26 טוקנים לשנייה על מקבוק בלי לשלוח מידע החוצה.

  • ניתוח מסמכים ארוכים

    מאפשר טעינת קבצים ענקיים לתוך חלון של 262K טוקנים עם תפיסת זיכרון של כ־12.8 גיגה בלבד.

  • שרת מקומי על כרטיס יחיד

    מאפשר לארח מודל חזק על GPU צרכני של 24 גיגה ומשאיר מקום רב לעיבוד מקבילי וקונטקסט מלא.

איפה זה נופל

הקוד לא מיועד למשימות פיתוח מורכבות של סוכנים, כמו ריצה על פני מספר קבצים, הרצת בדיקות ותיקון באגים בלולאה. בנוסף, למרות שהייצוג התיאורטי תופס 5.9 גיגה, בפועל הקרנלים הנוכחיים אורזים אותו בתוך 7.2 גיגה כי הם משתמשים במבנה של 2 ביט, מה שמונע ממנו לרוץ על טלפונים בגלל מגבלת הזיכרון של iOS. יש גם ירידה מורגשת יותר במשימות ראייה שירדו מ־72.61 ל־65.19, ובמעקב אחר הוראות מורכבות ב־IFBench שירד ל־58.5.

אותה משפחה

Ternary-Bonsai יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה צריך פורק מיוחד של llama.cpp בשביל להריץ אותו?

הקובץ PQ2_0 דורש קרנלים ייעודיים שיודעים לקרוא משקולות טרנריות בחלוקה לקבוצות של 128. אם אתם רוצים להשתמש ב־llama.cpp הרשמי בלי לקמפל גרסה מותאמת, צריך להוריד את קובץ ה־Q2_g64 שמחלק את המשקולות לקבוצות של 64.

איך מודל של 27B מצליח להיכנס לזיכרון כל כך קטן בלי להיהרס?

הוא משתמש בשלושה מצבים בלבד לכל משקל במקום דיוק רגיל, מה שמוריד את הנפח ל־1.71 ביט למשקל בפועל. מכיוון שהוא מבוסס על Qwen3.6 עם תשומת לב ליניארית ברוב השכבות, גם הזיכרון שנשמר עבור ההקשר קטן משמעותית ממודלים רגילים.

האם המודל כולל יכולות עיבוד תמונה מובנות?

כן, אבל מודל הראייה מופרד לקובץ חיצוני של כ־0.63 גיגה שנטען רק כשמעבירים תמונה בפועל. כשמריצים טקסט בלבד צריכת הזיכרון נשארת נמוכה ולא משלמים על רכיב הראייה.

איך מריצים

כדי להריץ אותו צריך זיכרון של כ־8.4 גיגה לקונטקסט בסיסי של 4K, או 14.7 גיגה ל־100K טוקנים בלי דחיסת קש. אם מפעילים דחיסת KV של 4 ביט, אפשר להחזיק 100K טוקנים בתוך 10.1 גיגה בלבד, מה שרץ חלק על כרטיס בודד של 16 או 24 גיגה ועל מחשבי מק. על שבב M5 Pro הוא מייצר 26.2 טוקנים לשנייה, ועל H100 הוא מגיע ל־98 טוקנים לשנייה.

ההרצה מתבצעת דרך פורק ייעודי של llama.cpp שתומך בקרנלים של Q2_0_g128, או דרך גרסת G64 אם עובדים עם הספריה הראשית. אם אין לכם חומרה מקומית מתאימה עם לפחות 16 גיגה זיכרון פנוי לעבודה ארוכת הקשר, או כשצריך לשרת עומס משתמשים כבד במקביל בלי להסתבך עם קרנלים מותאמים, עדיף לפנות ל־API מסחרי רגיל.

ollama run hf.co/prism-ml/Ternary-Bonsai-27B-gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו חופשי לצרכים מסחריים, לשנות את הקוד והמשקולות, לשלב אותו במוצרים סגורים ולהפיץ אותם הלאה. התנאים היחידים הם שמירה על הודעת זכויות היוצרים המקורית והצהרה על שינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗