GPT
B

Bonsai-demo

רץ בדפדפן

prism-mlרישיון לא דווח2026-04-01

  • docker

הדגמת צ'אט שמאפשרת לבחון מודלי שפה של 1 ביט ו־1.58 ביט על מעבד גרפי חזק. היא מתאימה למי שרוצה לבדוק בפועל פלט של מודלים מכווצים מאוד לפני הורדה.

  • הורדות בחודש
  • 104לייקים

מה זה

אתם כותבים הודעות טקסט רגילות ומקבלים תשובות בצ'אט, בדומה לכל ממשק שיחה סטנדרטי. המערכת כוללת תפריט לבחירת המודל מתוך סדרת Bonsai בגרסאות 1.7B, 4B ו־8B, הן בגרסת ביט בודד והן בגרסת Ternary של 1.58 ביט שבה כל משקל מקבל ערך של מינוס אחת, אפס או פלוס אחת. בנוסף, הממשק כולל לשונית הגדרות MCP שמאפשרת להפעיל קריאה לכלים כמו חיפוש ב־Brave ושליפת מאמרים מ־ArXiv.

מאחורי הקלעים רצים קובצי GGUF שמכווצים את המשקלים לגדלים זעירים. מודל 8B בביט בודד שוקל 1.15 גיגה בייט בלבד, לעומת 2.03 גיגה בייט בגרסת 1.58 ביט. הטכניקה הזו נועדה לשמור על ביצועים תחרותיים מול מודלים רגילים במשקל מלא, תוך הפחתה דרסטית בנפח הזיכרון והאצת קצב הפקת הטוקנים.

מתאים ל

  • בדיקת איכות תשובות ב־1 ביט

    בוחנים האם מודל מכווץ של 8B או 1.7B מספק תשובות הגיוניות ומדויקות מספיק למשימות המבוקשות.

  • השוואה בין ביט בודד ל־1.58

    מחליפים בין Bonsai לגרסת Ternary באותו גודל כדי לראות את ההבדל באיכות הטקסט מול תוספת המשקל.

  • בחינת חיבור לכלים חיצוניים

    מפעילים חיפוש רשת ב־Brave או שליפת מאמרים מ־ArXiv דרך הגדרות ה־MCP כדי לבדוק קריאת כלים.

איפה זה נופל

הבעיה המרכזית כרגע היא שההדגמה מושהית ולא מגיבה. מעבר לכך, המהירות שמציגה חומרת L40S לא משקפת את המהירות שתקבלו כשתריצו את המודלים על מחשב נייד או טלפון, שם הביצועים יהיו שונים לגמרי. בנוסף, המפתחים ציינו מראש שההדגמה תהיה זמינה לזמן מוגבל בלבד ולא מדובר בתשתית קבועה שאפשר לבנות עליה תהליכי עבודה.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

הגישה לעמוד פתוחה בחינם לגמרי ואינה דורשת תשלום. עם זאת, נכון לעכשיו ההדגמה במצב מושהה ולא ניתן לשלוח הודעות.

מה קורה לטקסט שכותבים בצ'אט?

לפי הצהרת המפתחים, תוכן השיחות אינו נשמר או מתועד בשרתים שלהם. היסטוריית השיחה נשמרת מקומית בלבד בדפדפן שלכם, אך הם מבקשים להימנע מהזנת נתונים רגישים.

האם אפשר להריץ את המודלים האלה מקומית?

כן, המודלים זמינים להורדה בפורמט GGUF ו־MLX ויכולים לרוץ על מחשבים ניידים ואפילו בדפדפן דרך WebGPU. הגדלים נעים בין 240 מגה בייט ל־2.03 גיגה בייט בלבד.

כמה מהר המודל עונה בהדגמה הזו?

ההדגמה מוגדרת לרוץ על מאיץ גרפי L40S ומגיעה לקצב של כ־330 טוקנים לשנייה במודל 8B. כאשר יש עומס משתמשים כבד ייתכנו זמני המתנה ותורים.

איך משתמשים

השימוש מתבצע דרך ממשק llama-server מובנה בדפדפן, בוחרים מודל מהרשימה ומתחילים להקליד ללא צורך בהרשמה. כרגע ההדגמה נמצאת במצב מושהה (PAUSED) ולכן לא ניתן להריץ בה שאילתות ישירות בעמוד. כשהיא פועלת, היא יושבת על כרטיס L40S שמסוגל לייצר סביב 330 טוקנים לשנייה עבור מודל 8B, אך מדובר במשאב משותף שעשוי לכלול תורים בעומס.

הרישיון

הרישיון של ההדגמה עצמה לא דווח במאגר, כך שמבחינה משפטית אין היתר שימוש ברור לקוד שלה. לגבי השיחות, המפתחים מצהירים שהם לא שומרים היסטוריה בשרת ושהמידע נשמר רק בזיכרון המקומי בדפדפן, אך הם עדיין ממליצים לא להזין מידע רגיש או סודי.

הרישיון המלא ב־Hugging Face ↗