GPT
B

Bonsai-27B-mlx-1bit

קוד פתוח

prism-mlapache-2.02026-07-04

  • mlx
  • safetensors
  • qwen3_5
  • conversational
  • 1-bit

זה מודל שמכווץ ארכיטקטורת 27B לגודל של פחות מ־4 גיגהבייט. המטרה שלו היא להריץ מודל חשיבה כבד מקומית על טלפונים ומחשבים ניידים בלי לשחוט את הזיכרון.

  • 1.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 1,343,051הורדות בחודש

מה זה

המודל הזה לוקח את Qwen3.6-27B וממיר את משקלי השפה לבינאריים של ביט בודד, עם פקטור סקייל של 16 ביט לכל קבוצה של 128 משקלים. הוא שוקל 3.9 גיגהבייט נטו במקום 54 גיגהבייט במקור, וכולל חלון הקשר של 262 אלף טוקנים שמבוסס ברובו על תשומת לב ליניארית. בנוסף משולב בו מודל ראייה מכווץ של 4 ביט שנשאר בחוץ עד שמזינים תמונה, ושכבת חיזוי להאצת פענוח.

בבדיקות של מצב חשיבה הוא מחזיק ממוצע של 76.11 מתוך 15 מבחנים, שזה 89.5% מהביצועים של המודל המקורי. המספרים מראים שהמתמטיקה נשמרת יחסית יפה עם 91.66 נקודות, ותכנות עומד על 81.88. מודלים אחרים שדחסו מתחת ל־4 ביט פשוט קרסו במשימות חשיבה מורכבות, וכאן הדחיסה מחזיקה מעמד.

מתאים ל

  • חשיבה וחישוב על אייפון

    מאפשר הרצה של מודל עם יכולות מתמטיות גבוהות ישירות בזיכרון של מכשיר נייד בלי חיבור לרשת.

  • סוכן מקומי על לפטופ

    ניתוח מסמכים ארוכים בקונטקסט מלא של 262 אלף טוקנים על זיכרון עבודה צנוע של מקבוק.

  • מערכות פרטיות לחלוטין

    עיבוד מידע רגיש בארגון שלא יכול להוציא אף בייט לענן וצריך תשובות מורכבות מחומרה מינימלית.

איפה זה נופל

הנפילה הגדולה היא בהבנת הוראות מורכבות, שם הוא מקבל 65.74 נקודות, ובמשימות סוכנים עם 66.03 נקודות, לעומת 80 ומעלה במקור. הכרטיס מודה במפורש שתכנות סוכני שדורש סבבים ארוכים של ריצה, בדיקה ותיקון שגיאות לא מתאים לגרסה הזו. על טלפונים יש בעיה של התחממות שמורידה את הקצב עם הזמן, והראייה חלשה משמעותית מהמקור עם 59.57 נקודות.

שאלות
נפוצות

האם המודל תומך בעברית?

אין בכרטיס המודל נתונים או בדיקות לגבי ביצועים בעברית. מאחר והוא מבוסס על סדרת Qwen שתומכת בשפות רבות, הבסיס קיים, אך חובה לבדוק אותו עצמאית לפני שמשלבים אותו במוצר שמיועד לשפה זו.

למה קבצי ה־MLX שוקלים יותר מ־3.9 גיגהבייט?

המשקל המקורי של 3.9 גיגהבייט מתייחס למשקלי השפה בפורמט גולמי. אריזת ה־MLX דורשת שמירת סקייל והיסט נפרדים לכל קבוצה, מה שמעלה את הגודל ל־5.13 גיגהבייט בדיסק וכולל גם את רכיב הראייה.

האם שכבת ה־DSpark פועלת על מק?

לא כברירת מחדל. שכבת החיזוי Speculative Decoding מאיצה את הריצה פי 1.37 רק על גבי שרתי CUDA, אך על מעבדי אפל סבב האימות הבודד עדיין לא יעיל מספיק ולכן היא מנוטרלת.

איך מריצים

בשביל להריץ אותו דרך MLX על מק או אייפון צריך את הפורקים היעודיים של Prism ML לספריות, כי הם כוללים קרנלים מיוחדים לחישובי 1 ביט ישירות מהזיכרון. במקבוק עם M4 Pro הוא מייצר 26 טוקנים לשנייה, ב־M5 Pro הוא מגיע ל־44, ועל אייפון 17 פרו מקס הקצב יורד לאזור 11 טוקנים לשנייה. אריזת ה־MLX הזו תופסת 5.13 גיגהבייט בדיסק בגלל מגבלות הפורמט של אפל.

אם אתם לא צריכים ריצה מקומית על מכשיר קצה אלא רק מריצים שרת בודד עם GPU, כדאי לשקול לקרוא ל־API או להריץ את גרסת הטרנרי של 2 ביט. בשרתים המודל הבינארי לא נותן יתרון מהירות משמעותי כי צוואר הבקבוק שם הוא שיגור הקרנלים ולא רוחב הפס של המשקלים.

pip install -U huggingface_hub
hf download prism-ml/Bonsai-27B-mlx-1bit

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאים היחידים הם שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗