GPT
T

Ternary-Bonsai-8B-gguf

קוד פתוח

prism-mlרישיון לא דווח2026-04-18

  • gguf
  • ternary
  • 1.58-bit
  • llama-cpp
  • q2_0

גרסה מכווצת של מודל שמונה מיליארד פרמטרים ששוקלת רק שני גיגהבייט. היא מיועדת למי שרוצה להריץ מודל מקומית על חומרה חלשה בלי לוותר לגמרי על היכולות.

  • 21.5 GBמשקל הקבצים
  • 373,740הורדות בחודש
  • 148לייקים

מה זה

הבסיס פה הוא Qwen3-8B שעבר המרה לערכים טרינריים של 1.58 ביט, מה שמאפשר לו להחזיק משקלים של מינוס אחת, אפס ופלוס אחת בלבד. במקום לתפוס מעל 16 גיגהבייט בזיכרון כמו גרסת ה־FP16 המקורית, קובץ ה־Q2_0 המומלץ יורד ל־2.03 גיביבייט. המודל שומר על חלון הקשר של 65,536 תווים ומכסה בשיטה הזו את כל שכבות הטרנספורמר, כולל האמבדינג וראש השפה.

במבחני ביצועים מול מודלים אחרים באותו גודל פרמטרים, הוא רושם ציון ממוצע של 75.5 לעומת 79.3 של מודל המקור. הנפילה המשמעותית מורגשת בידע כללי ב־MMLU-R עם 72.6 לעומת 83, ובקריאות לפונקציות ב־BFCL שירד ל־73.9. במעקב אחרי הוראות ב־IFEval הוא דווקא עוקף במעט את מודל המקור עם 81.8, ומנצח מודלים מלאים כמו Ministral3 ו־Olmo 3 למרות שהוא תופס שמינית מהנפח שלהם.

מתאים ל

  • עבודה מקומית על מחשב נייד

    משקל של שני גיגהבייט מאפשר להריץ אותו ברקע על מחשב אישי בלי לטחון זיכרון ובלי כרטיס מסך ייעודי.

  • עיבוד טקסט ומעקב הוראות

    הוא שומר על ציון IFEval גבוה ומטפל בהוראות מורכבות כמעט כמו מודל בגודל מלא.

  • הטמעה במכשירי קצה

    דרישות הזיכרון הנמוכות מאפשרות שילוב במערכות משובצות קטנות שמוגבלות בנפח RAM.

איפה זה נופל

הקיצוץ האגרסיבי ל־1.58 ביט פוגע קודם כל במשימות שדורשות דיוק עובדתי וחיבור לכלים חיצוניים. היכולת שלו להפעיל פונקציות חלשה משמעותית ממודל המקור, עם ירידה מ־81 ל־73.9 נקודות במבחן BFCL. בנוסף, המודל הזה דורש שימוש בגרסת תוכנה נפרדת ולא רשמית של llama.cpp, מה שאומר שכלים קיימים שתלויים בגרסה המרכזית לא יעבדו איתו ישר מהקופסה בלי התאמות ידניות.

אותה משפחה

Ternary-Bonsai יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות בכל תוכנה שתומכת בקובצי GGUF?

לא כרגע. הפורמט הספציפי שבו נשמרו המשקלים דורש תמיכה בקרנלים של PrismML שעדיין נמצאים בפיצול שלהם. תצטרכו להוריד ולקמפל את המאגר שלהם כדי להעלות את השרת או להשתמש ב־CLI.

איזה קובץ צריך להוריד מתוך המאגר?

עבור הרצה שוטפת מורידים את Ternary-Bonsai-8B-Q2_0.gguf ששוקל קצת יותר משני גיגהבייט. קובץ ה־FP16 שוקל מעל 16 גיגהבייט ומיועד רק כבסיס לכיול מחדש, אין טעם להריץ אותו בפועל.

איך מריצים

קובץ ה־Q2_0 שוקל 2.18 גיגהבייט בלבד, כך שאפשר להריץ אותו בקלות על כל מעבד מודרני או מחשב נייד בלי כרטיס מסך ייעודי. על מעבד M4 Pro ב־Metal הוא מגיע ל־76 טוקנים לשנייה ביצירת טקסט, ועל מעבד מרכזי בלבד עם עשרה תהליכונים הוא מוציא 32 טוקנים לשנייה.

העניין הטכני המרכזי הוא התמיכה בפורמט. הליבות של Q2_0 עבור המבנה הזה עדיין לא מוזגו לגרסה הראשית של llama.cpp, ולכן צריך לשכפל ולקמפל את הפיצול של PrismML מגיטהאב כדי להפעיל אותו. אם אין לכם עניין להתעסק עם קומפילציה מקומית של ספריות C++, עדיף להמתין שהקוד ייכנס רשמית למאגר המרכזי.

ollama run hf.co/prism-ml/Ternary-Bonsai-8B-gguf:Ternary-Bonsai-8B-PQ2_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בטבלת המפרט בכרטיס המודל מופיע רישיון Apache 2.0, למרות שמטא הדאטה של המאגר מציין שלא דווח רישיון. רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

הרישיון המלא בעמוד המודל ↗