GPT
T

Ternary-Bonsai-27B-mlx-2bit

קוד פתוח

prism-mlapache-2.02026-07-04

  • mlx
  • safetensors
  • qwen3_5
  • conversational
  • ternary

גרסה מכווצת של מודל 27B שרצה מקומית על מחשב נייד בלי לחסל את הזיכרון. היא שומרת על יכולות חשיבה ומתמטיקה קרוב למקור, בנפח של פחות משמונה גיגה-בייט.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.9 GBמשקל הקבצים
  • 1,338,305הורדות בחודש

מה זה

המודל מבוסס על הארכיטקטורה של Qwen3.6-27B ומשתמש בייצוג משקלים טרנרי, שבו כל משקל מקבל אחד משלושה ערכים בלבד. הכיווץ מביא את גודל הקבצים לכ־7.9 גיגה-בייט, ירידה דרסטית לעומת 54 גיגה-בייט במקור, אבל בלי ההתרסקות שרואים בדרך כלל בקוונטיזציה של שתי סיביות. השלד משלב כ־75 אחוז תשומת לב ליניארית, מה שמקל על ניהול הזיכרון בריצות ארוכות.

בבדיקות השוואתיות של מצב חשיבה, המודל השיג ציון ממוצע של 80.49 על פני 15 מדדים, שהם כ־95 אחוזים מביצועי המודל המלא, לעומת גרסאות שתי סיביות רגילות שצונחות לאזור ה־72. במתמטיקה הוא מגיע ל־93.4 לעומת 95.3 במקור, ובקוד הוא עומד על 85.96. במשימות שדורשות היגיון רציף הוא מחזיק מעמד, בניגוד לשיטות כיווץ ישנות שנשברות במבחנים כמו AIME.

מתאים ל

  • ניתוח מסמכים ארוכים על מק

    חלון של 262 אלף טוקנים נכנס במלואו לזיכרון של מחשב נייד ומאפשר סריקת קבצים ענקיים בלי לשלוח מידע לרשת.

  • עוזר תכנות מקומי

    עם ציון 93.9 ב־HumanEval+, הוא מספק השלמות קוד מדויקות ישירות מהמעבד הגרפי המקומי בקצב סביר.

  • פתרון בעיות מתמטיקה

    שומר על ציון 99.2 במבחן MATH-500 ואינו מאבד את יכולת ההסקה השלבית למרות הדחיסה הכבדה.

איפה זה נופל

הנפילה העיקרית מורגשת ביכולות מורכבות של סוכנים ובמעקב אחרי הוראות. במבחן IFBench המודל צונח ל־58.5 לעומת 68 במקור, ושימוש בכלים יורד ל־74. המפתחים מודים בפירוש שסביבות פיתוח מבוססות סוכנים, שמריצות טסטים ומתקנות קוד עצמאית בכמה קבצים, אינן יעד חזק בגרסה הזו. בנוסף, הנפח חורג מתקרת שש הגיגה-בייט באפליקציות iOS, כך שהוא לא יעלה על טלפונים ניידים.

שאלות
נפוצות

האם המודל יכול לרוץ על מחשב נייד עם 16 גיגה-בייט זיכרון?

כן, למשימות רגילות. המשקלים עצמם דורשים כ־7.6 גיגה-בייט בזיכרון ה־MLX, ובפרומפטים של 4K טוקנים צריכת הזיכרון הכוללת היא כ־9.2 גיגה-בייט. אם תרצו להעמיס הקשר ענק של מעל 100K טוקנים, תצטרכו להפעיל דחיסת KV של 4 ביט כדי לא לחרוג ממגבלת הזיכרון של המחשב.

למה הקבצים שוקלים 7.9 גיגה אם המודל מוגדר כ־1.71 ביט למשקל?

מנועי ההרצה הנוכחיים שומרים כל ערך טרנרי בתוך בית של שתי סיביות בפועל, ולא בפורמט הדחוס התיאורטי. בנוסף, האריזה עבור MLX שומרת מקדם וסטייה לכל קבוצה, מה שמנפח מעט את הקובץ בדיסק ל־8.49 גיגה יחד עם שכבת התמונות.

איך מריצים

הגרסה הזו ארוזה עבור MLX ורצה ישירות על מחשבי מק עם Apple Silicon דרך מעבד גרפי מקומי וזיכרון אחוד. על מחשב עם מעבד M5 Pro הוא מייצר כ־26 טוקנים לשנייה, ועל M5 Max הוא מגיע ל־44. בחלון של 100K טוקנים צריכת הזיכרון בפועל עומדת על כ־15.5 גיגה-בייט ללא דחיסת זיכרון מטמון, או יורדת לכ־10.1 גיגה-בייט כשמפעילים דחיסת KV של 4 ביט.

אם אתם על שרתי לינוקס עם כרטיסי אנבידיה, עדיף לקחת את גרסת ה־GGUF שמנצלת קרנלים ייעודיים ב־llama.cpp ומפעילה מודל טיוטה קטן בשם DSpark להאצת יצירת הטקסט. שירות API חיצוני יהיה עדיף רק אם אתם צריכים תעבורה כבדה למשתמשים רבים במקביל, שכן ריצה מקומית על מחשב נייד מוגבלת בעיקר לעבודה אישית.

pip install -U huggingface_hub
hf download prism-ml/Ternary-Bonsai-27B-mlx-2bit

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תמלוגים. הדרישה העיקרית היא לכלול את הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗