GPT
B

Bonsai-1.7B-gguf

קוד פתוח

prism-mlapache-2.02026-03-29

  • llama.cpp
  • gguf
  • 1-bit
  • llama-cpp
  • cuda

מודל שפה שמכווץ לגודל של 0.24 גיגה בייט בלבד. הוא פונה למי שחייב להריץ מודל מקומית על טלפונים או חומרה חלשה במיוחד בלי לתפוס זיכרון.

  • 474 MBמשקל הקבצים
  • 65,613הורדות בחודש
  • 91לייקים

מה זה

הפיתוח הזה מבוסס על ארכיטקטורת Qwen3 בנפח 1.7 מיליארד פרמטרים, אבל עם כיול קיצוני של ביט בודד לכל משקל מקצה לקצה. במקום הדיוק הרגיל, כל משקל מקבל ערך חיובי או שלילי לפי סקייל משותף לקבוצות של 128 ערכים. השיטה הזו חותכת את צריכת הזיכרון ביותר מתשעים אחוז לעומת המקור.

מבחינת ביצועים, המדידות מציגות מהירויות גבוהות מאוד. על כרטיס RTX 4090 הוא מפיק 674 טוקנים לשנייה, ועל מעבד M4 Pro מגיעים ל־250 טוקנים לשנייה. אלה קצבים מהירים פי שלושה עד כמעט פי ארבעה בהשוואה למודל המקורי, בעיקר בגלל שנפח התעבורה בזיכרון נחתך כמעט לגמרי.

מתאים ל

  • עבודה מקומית במובייל

    המשקל הזעיר מאפשר לשלב מודל בתוך אפליקציית iOS או אנדרואיד בלי לנפח את קובץ ההתקנה.

  • מיון טקסט במכשיר קצה

    הקצב הגבוה מתאים לסיווג מהיר של הודעות או פקודות פשוטות בלי לשלוח מידע לרשת.

  • שרתים עם משאבים מינימליים

    הוא צורך רבע גיגה זיכרון בלבד, מה שמאפשר להריץ אותו על שרתים וירטואליים זולים במיוחד.

איפה זה נופל

הקוונטיזציה לביט בודד גובה מחיר כבד מאוד ביכולות ההבנה והיצירה של המודל. הדף הרשמי מציג מדדי מהירות בלבד ומתעלם לחלוטין ממבחני איכות, דיוק או שימור יכולות. בנוסף, חלון ההקשר אמנם מוגדר ל־32,768 טוקנים, אבל בנפח פרמטרים כזה וברמת דחיסה כזו, סביר מאוד שהוא יאבד קוהרנטיות בטקסטים ארוכים.

אותה משפחה

Bonsai יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו עם גרסה רגילה של llama.cpp?

לא. נכון לעכשיו צריך להוריד ולקמפל את הפורק הייעודי של Prism ML. הקרנלים שמפענחים את הדחיסה של ביט אחד טרם נכנסו לקוד הראשי.

האם כדאי להשתמש בו לייצור תוכן מורכב?

ממש לא. דחיסה לביט בודד על מודל של 1.7 מיליארד פרמטרים פוגעת קשות ברמת הדיוק. הוא מתאים למשימות מוגדרות ופשוטות ולא לכתיבה יוצרת או ניתוח עמוק.

איך מריצים

כדי להריץ אותו צריך להשתמש בפורק ייעודי של llama.cpp שכולל קרנלים מותאמים לפורמט Q1_0. מקמפלים את הפרויקט עם תמיכת CUDA או Metal, וטוענים את קובץ ה־GGUF ששוקל כרבע גיגה. דרישות החומרה מינימליות לחלוטין ומתאימות לכל מחשב נייד ישן או סמארטפון.

אם אתם צריכים איכות טקסט גבוהה או תשובות מורכבות בעברית, עדיף להשתמש ב־API חיצוני של מודל גדול. הפתרון הזה נועד אך ורק למצבים שבהם אתם חייבים חישוב מקומי, אופליין ובנפח אחסון אפסי.

ollama run hf.co/prism-ml/Bonsai-1.7B-gguf:Bonsai-1.7B

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי הקוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗