GPT
B

Bonsai-4B-gguf

קוד פתוח

prism-mlapache-2.02026-03-29

  • llama.cpp
  • gguf
  • 1-bit
  • llama-cpp
  • cuda

גרסה מכווצת ברמת ביט בודד למשקל שמיועדת למכשירים חלשים במיוחד. היא תופסת קצת יותר מחצי גיגה זיכרון ומגיעה למהירויות פליטה גבוהות מאוד.

  • 1.1 GBמשקל הקבצים
  • 21,584הורדות בחודש
  • 60לייקים

מה זה

מדובר במודל שפה עם ארבעה מיליארד פרמטרים שמבוסס על ארכיטקטורת Qwen3-4B, אך עבר קוונטיזציה קיצונית של ביט בודד לכל משקל בפורמט ייעודי בשם Q1_0. בניגוד לשיטות כיול רגילות שמשאירות חלק מהשכבות בדיוק גבוה, כאן כל הרכיבים כולל האמבדינגס ושכבות הפלט מכווצים, מה שמביא את צריכת הזיכרון של הפרמטרים ל־0.57 גיגה בלבד, צניחה של 93 אחוז מול המקור.

מבחינת ביצועים מעשיים, המספרים מתמקדים אך ורק במהירות חומרה ולא במבחני דיוק. על כרטיס RTX 4090 הוא מפיק 440 טוקנים לשנייה, שזה פי 4.2 מגרסת ה־FP16 הרגילה, ועל מעבד M4 Pro הוא מייצר 136 טוקנים לשנייה. המטרה המרכזית פה היא מהירות ודריסת רגל זעירה.

מתאים ל

  • עוזר מקומי באפליקציות מובייל

    משקל של חצי גיגה מאפשר להטמיע אותו ישירות באפליקציית iOS או אנדרואיד בלי לחנוק את זיכרון המכשיר.

  • מערכות משובצות ומחשבי קצה

    מתאים לכרטיסי פיתוח ומכשירים נטולי מעבד גרפי חזק, שבהם זיכרון ה־RAM מוגבל מאוד וצריך תגובה מיידית.

  • סינון וסיווג מהיר ברקע

    מהירות ייצור של מעל 400 טוקנים לשנייה מאפשרת לעבד טקסטים קצרים בקצב גבוה על חומרה מקומית בסיסית.

איפה זה נופל

דף המודל לא מציג אף ציון במבחני ידע, הבנה, כתיבת קוד או שפות אחרות מלבד אנגלית. דחיסה לביט בודד גובה מחיר כבד מאיכות הטקסט ומהיכולת לעקוב אחרי הוראות מורכבות, ואין שום מידע על היכולות שלו בעברית. לפני שמכניסים אותו לשימוש אמיתי חייבים לבדוק נקודתית שהוא לא מייצר הזיות מוגזמות או מאבד לחלוטין את ההיגיון במשימה שלכם.

אותה משפחה

Bonsai יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יכול לרוץ על גרסת llama.cpp הרשמית שכבר מותקנת אצלי?

לא, הפורמט של ביט בודד Q1_0 דורש קרנלים ייעודיים שלא קיימים בגרסה הראשית. תצטרכו להוריד ולקמפל את הפורק שפרסמה PrismML כדי לטעון את הקובץ.

האם שווה לבחור בו אם יש לי מחשב חזק עם כרטיס מסך מודרני?

כנראה שלא. קוונטיזציה לביט בודד נועדה לפתור בעיית חומרה קיצונית, ואם יש לכם זיכרון פנוי עדיף להריץ מודלים קטנים ב־4 או 8 ביט כדי לקבל איכות פלט סבירה יותר.

איך מריצים

בשביל להריץ אותו לא צריך כרטיס מסך מפלצתי. הוא ירוץ כמעט על כל מחשב, מעבדי אפל, ואפילו טלפונים ניידים שמריצים אנדרואיד או iOS, הודות לנפח של חצי גיגה בלבד. עם זאת, אי אפשר להשתמש בהפצה הרגילה של llama.cpp אלא חייבים להוריד ולקמפל את הפורק הייעודי של PrismML שכולל את הקרנלים של Q1_0.

אם אתם צריכים את המודל לשרת מרכזי עם משאבים סבירים, אין שום סיבה להריץ קוונטיזציה של ביט בודד. במצב כזה עדיף לקחת מודל 4B או 8B סטנדרטי בקוונטיזציה מתונה יותר או לפנות ל־API חיצוני, כי המאמץ בקמפול מיוחד מוצדק רק כשנלחמים על כל מגה־בייט במכשיר הקצה.

ollama run hf.co/prism-ml/Bonsai-4B-gguf:Bonsai-4B

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗