GPT
B

Bonsai-8B-mlx-1bit

קוד פתוח

prism-mlapache-2.02026-03-18

  • mlx
  • safetensors
  • qwen3
  • 1-bit
  • mlx-swift

גרסת קוונטיזציה של ביט בודד למודל שפה, שרצה ישירות על חומרת אפל. היא מיועדת למי שרוצה ביצועים של מודל שמונה מיליארד פרמטרים בתוך נפח זיכרון של ג'יגה בייט ורבע בלבד.

  • 384Mפרמטרים
  • 65,536טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 10,638הורדות בחודש

מה זה

המודל הזה לוקח את הארכיטקטורה של Qwen3 ומכווץ את כל המשקולות, כולל שכבות ה־embeddings וה־head, לביט יחיד בפורמט מותאם ל־MLX. גודל המשקולות בזיכרון עומד על 1.28 גיגה בייט, לעומת יותר מ־16 גיגה בייט בגרסת המקור. הדחיסה הזו מגיעה עם חלון הקשר מלא של 65,536 טוקנים, כך שאפשר להזין טקסטים ארוכים בלי לחנוק את המכשיר.

במבחני ביצועים מול מודלים אחרים באותו סדר גודל, הוא מציג ציון ממוצע של 70.5 נקודות. זה נמוך מה־79.3 של Qwen 3 המקורי בגודל מלא, אבל עדיין עוקף מודלים כמו Llama 3.1 8B ששוקלים פי 14 ממנו. ב־GSM8K הוא מקבל 88 וב־IFEval מגיע ל־79.8, מה שמראה שהוא שומר על יכולת מעקב אחרי הוראות ופתרון בעיות, למרות הדחיסה האגרסיבית.

מתאים ל

  • עוזר מקומי למכשירי אייפון

    צריכת הזיכרון הנמוכה של 1.28 גיגה מאפשרת הרצה חלקה של 44 טוקנים לשנייה ישירות על הטלפון.

  • עיבוד מסמכים על מחשבי מק

    חלון של 65,536 טוקנים לצד קצב של 131 טוקנים לשנייה ב־M4 Pro מתאימים לעבודה עם טקסט ארוך.

  • מערכות קצה מוגבלות זיכרון

    הוא נכנס למכשירים שלא מסוגלים להחזיק מודל שמונה מיליארד סטנדרטי בלי לחרוג ממגבלות החומרה.

איפה זה נופל

ההגבלה הגדולה ביותר היא שאין כיום חומרה שמריצה ביט בודד בצורה טבעית ברמת הסיליקון, כך שכל שיפורי המהירות נשענים על קרנלים ייעודיים בתוכנה שדורשים מזלג של MLX ולא גרסה רשמית יציבה. בנוסף, ביצועי הידע הכללי נשחקו בדחיסה, כפי שרואים במבחן MMLU-R שבו הוא משיג 65.7 לעומת 83 במקור. לפני שמכניסים אותו למוצר צריך לבדוק היטב דיוק בניואנסים, שכן נתוני צריכת החשמל במובייל התבססו על הערכות תוכנה ולא על מדידת חומרה פיזית.

שאלות
נפוצות

האם אפשר להריץ אותו עם ספריית MLX הרגילה של אפל?

לא כרגע. התמיכה בקרנלים של ביט בודד דורשת התקנה של המזלג שפותח על ידי PrismML ישירות מגיטהאב, מכיוון שהשינויים טרם מוזגו לספרייה הרשמית.

כמה זיכרון דרוש בפועל כדי להעלות את המודל?

המשקולות והסקלרים תופסים 1.28 גיגה בייט בזיכרון, והתיקייה בדיסק שוקלת כ־1.30 גיגה בייט כולל הטוקנייזר וההגדרות. זה אומר שגם מחשב או טלפון עם זיכרון צנוע יכולים לטעון אותו בלי בעיה.

איך מריצים

כדי להריץ אותו צריך מחשב מק או מכשיר iOS, יחד עם התקנה של המזלג הייעודי של PrismML לספריית MLX, כיוון שהקרנלים של ביט אחד עדיין תלויים ב־Pull Request פתוח. במחשב M4 Pro עם 48 גיגה זיכרון הוא מייצר 131 טוקנים לשנייה, ובאייפון 17 פרו מקס הוא מגיע ל־44 טוקנים לשנייה באמצעות MLX Swift. קיים גם פורמט GGUF נפרד שמיועד לעבודה עם llama.cpp.

אם אתם על חומרת אפל ומחפשים הרצה מקומית מלאה בלי תלות ברשת ובלי עלויות שרת, ההרצה כאן פשוטה ומהירה מאוד. לעומת זאת, אם אתם עובדים על שרתי ענן כלליים מבוססי לינוקס או צריכים שילוב בסביבה מרובת פלטפורמות בלי לנהל קרנלים מותאמים אישית, עדיף לפנות ל־API חיצוני.

pip install -U huggingface_hub
hf download prism-ml/Bonsai-8B-mlx-1bit

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות, והפצה מחדש בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗