GPT
B

Bonsai-8B-gguf

קוד פתוח

prism-mlapache-2.02026-03-18

  • llama.cpp
  • gguf
  • 1-bit
  • llama-cpp
  • cuda

גרסת 1-ביט למודל של 8 מיליארד פרמטרים שתופסת רק 1.15 גיגה בזיכרון. הוא מתאים למי שחייב להריץ מודל סביר ישירות על מחשב נייד חלש או טלפון בלי לשלם על שרתים.

  • 2.2 GBמשקל הקבצים
  • 120,640הורדות בחודש
  • 780לייקים

מה זה

המודל הזה מבוסס על ארכיטקטורת Qwen3-8B ומכווץ בשיטת Q1_0 שמשאירה כמעט ביט בודד לכל משקל, 1.125 ביטים בפועל יחד עם המקדמים. במקום להחזיק משקלים בנפח של 16 גיגה, כל המודל יושב בפחות מגיגה וחצי של זיכרון, כולל שכבות ה־embeddings וה־LM head. ההבדל הגדול ביחס לכימות רגיל הוא ביטול הצורך לפתוח את המשקלים חזרה לדיוק מלא בזמן הריצה, מה שחוסך תעבורת זיכרון בצורה דרסטית.

במבחני ביצועים מול דגמי 8B אחרים בגודל מלא, הוא מוציא ציון ממוצע של 70.5 נקודות לעומת 79.3 של Qwen 3 המקורי ו־67.1 של Llama 3.1. במבחני קוד (HE+) הוא מגיע ל־73.8 וב־GSM8K ל־88. הפגיעה המורגשת ביותר היא במבחני הבנה רב-תחומית (MMLU-R), שם הוא נעצר ב־65.7 מול 83 של המקור. הוא לא מנצח מודלי 8B מובילים, אבל הוא נותן רמה תחרותית מאוד בעשירית מהנפח שלהם.

מתאים ל

  • הפעלה על טלפונים ומובייל

    צורך רק 1.15 גיגה זיכרון ומאפשר לייצר כמעט 20 טוקנים לשנייה על מעבד מובייל בלי לפנות לשרת.

  • עוזר מקומי במחשב נייד חלש

    מאפשר הרצה מלאה על כרטיסי מסך בסיסיים כמו RTX 3060 Laptop במהירות של מעל 80 טוקנים לשנייה.

  • רובוטיקה ומערכות קצה

    מתאים למכשירי קצה מוגבלי חשמל וזיכרון בזכות צריכת אנרגיה נמוכה משמעותית לכל טוקן.

איפה זה נופל

הכיווץ לביט בודד מוריד את היכולות הלוגיות וההבנה הרחבה ביחס למודל הבסיס. במבחן MMLU-R המודל מאבד יותר מ־17 נקודות לעומת Qwen 3 המקורי. בנוסף, אין כיום חומרה שמיועדת ברמת הסיליקון לחישובי 1-ביט, ולכן כל שיפורי המהירות נשענים על אופטימיזציה ברמת התוכנה והקרנלים. מעבר לזה, המדידות עבור מכשירי מובייל מבוססות על הערכות תוכנה ולא על מדידות חומרה בפועל של צריכת החשמל.

אותה משפחה

Bonsai יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו עם הגרסה הראשית של llama.cpp?

לא ישירות. צריך לשכפל ולהדר את ה־fork של PrismML כדי לקבל את התמיכה בקרנלים שמפענחים את פורמט Q1_0 בזמן אמת.

כמה נפח המודל תופס בפועל בדיסק ובזיכרון?

הקובץ בדיסק שוקל 1.16 גיגה, והמשקלים דורשים 1.15 גיגה של זיכרון עבודה כדי להיטען במלואם.

איך מריצים

בשביל להריץ אותו צריך זיכרון וידאו זעיר, פחות מ־2 גיגה כולל ה־context, מה שאומר שהוא רץ על כמעט כל מחשב עם מעבד גרפי צנוע. בנייד עם כרטיס RTX 3060 הוא מוציא 81 טוקנים לשנייה, לעומת 3.5 טוקנים בלבד שהמודל המקורי הצליח לספק על אותו חומרה בגלל מגבלות VRAM. הוא רץ גם על מחשבי מק עם שבבי אפל ועל מעבדי טלפונים דרך OpenCL.

ההרצה דורשת שימוש ב־fork ייעודי של ספריית llama.cpp שכולל את הקרנלים של Q1_0, כך שאי אפשר להשתמש כרגע בגרסה הרשמית בלי להדר אותה מהמאגר של PrismML. אם המערכת שלכם יושבת בענן ויש לכם תקציב לתשתיות רגילות, קריאה ל־API מסחרי עדיין תיתן דיוק גבוה יותר בפחות התעסקות עם ספריות ייעודיות.

ollama run hf.co/prism-ml/Bonsai-8B-gguf:Bonsai-8B

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצרים ולהפיץ אותו הלאה. התנאים היחידים הם שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗