GPT
T

Ternary-Bonsai-8B-mlx-2bit

קוד פתוח

prism-mlרישיון לא דווח2026-04-13

  • mlx
  • safetensors
  • qwen3
  • ternary
  • 1.58-bit

גרסה מכווצת של Qwen3-8B למכשירי אפל שתופסת כ־2.2 גיגה־בייט בלבד. היא מיועדת למי שרוצה ביצועים של מודל שמונה מיליארד פרמטרים ישירות על מק או אייפון בלי שרת.

  • 65,536טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 15,933הורדות בחודש
  • 122לייקים

מה זה

המודל לוקח את Qwen3-8B ודוחס את המשקלים שלו למבנה טרנארי של מינוס אחת, אפס ואחת, עם סקיילינג בקבוצות של 128. במקום לתפוס מעל 16 גיגה־בייט בפורמט הרגיל, כל הקבצים שוקלים 2.3 גיגה־בייט. החידוש מול גרסת הביט הבודד הקודמת הוא תוספת האפס, שמשמרת הרבה יותר מהאינטליגנציה המקורית ומעלה את הציון הממוצע במבחנים מ־70.5 ל־75.5.

במבחני הביצועים הוא עדיין מפסיד למודל המקורי, במיוחד בידע כללי ובתכנות. ב־MMLU-R הוא יורד מ־83 ל־72.6, ובקריאת פונקציות מ־81 ל־73.9. מצד שני, בהוראות מורכבות כמו IFEval הוא שומר על 81.8, ובמתמטיקה עם GSM8K הוא מגיע ל־91 לעומת 93 במקור. מול מודלים אחרים בגודל שמונה מיליארד פרמטרים במשקל מלא, הוא נותן תוצאות דומות מאוד בשבריר מנפח הזיכרון.

מתאים ל

  • עוזר מקומי למק

    צורך מעט מאוד זיכרון עבודה ומייצר מעל 80 טוקנים לשנייה על שבבי אפל בלי לשלוח מידע לרשת.

  • פיצ׳רים מיידיים לאייפון

    משקל של 2.3 גיגה מאפשר להטמיע מודל 8B ישירות באפליקציית iOS עם זמן תגובה מהיר.

  • עיבוד טקסטים ארוכים

    תמיכה בחלון הקשר של 65,536 טוקנים על גבי מחשב נייד בלי לחנוק את המערכת.

איפה זה נופל

החיסרון המיידי הוא התלות המוחלטת בסביבת אפל. אין תמיכה בפורמטים אחרים או במאיצים גרפיים שאינם Apple Silicon בגרסה הזו. בנוסף, הדחיסה הקיצונית מורגשת ביכולות קידוד וקריאת פונקציות, שם נרשמה ירידה מורגשת לעומת המודל המלא. מפתחי המודל מציינים גם שמדידות צריכת החשמל והסוללה במכשירים ניידים מבוססות על הערכות תוכנה ולא נמדדו ישירות ברמת החומרה, כך שצריך לבדוק בפועל איך הוא משפיע על התחממות וסוללה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס של אנבידיה או שרת רגיל?

לא כרגע. הקבצים נארזו במבנה שמיועד בלעדית לקרנלים של ספריית MLX על מעבדי אפל. המפתחים ציינו שפורמטים נוספים יגיעו בהמשך, אבל בגרסה הזו אין תמיכה ב־CUDA או vLLM.

איך הביצועים שלו בהשוואה לגרסת ה־4 ביט הרגילה?

בבדיקה על אייפון 17 פרו מקס הוא מייצר 27 טוקנים לשנייה לעומת 14 בגרסת 4 ביט, שזה כמעט פי שניים מהירות. היתרון הגדול הוא נפח האחסון והזיכרון, שנחתך ביותר מחצי ומפנה משאבים למערכת ההפעלה.

איך מריצים

ההרצה מוגבלת כרגע לחומרת אפל בלבד דרך ספריית mlx בפייתון או mlx-swift ב־iOS ומק. על מעבד M4 Pro מגיעים לקצב של 83 טוקנים לשנייה ביצירת טקסט, פי חמישה מהמודל המקורי. באייפון 17 פרו מקס המודל מייצר 27 טוקנים לשנייה, שזה קצב שמיש לחלוטין לשיחה בזמן אמת.

דרישות החומרה נמוכות מאוד וכל מק או מכשיר נייד מודרני של אפל יחזיק אותו בזיכרון בלי מאמץ. אם המוצר שלכם צריך לרוץ על שרתי לינוקס, כרטיסי אנבידיה או מכשירי אנדרואיד, אין לכם מה לעשות עם המשקלים האלה כרגע, ועדיף פשוט לקרוא ל־API חיצוני רגיל.

pip install -U huggingface_hub
hf download prism-ml/Ternary-Bonsai-8B-mlx-2bit

הרישיון

בטבלת המפרט המפתחים כתבו שהמודל תחת רישיון אפאצ׳י 2.0, שמאפשר שימוש מסחרי חופשי והפצה. עם זאת, במטא־דאטה הרשמי של המאגר לא הוגדר רישיון כלל. הפער הזה יוצר סיכון משפטי מסוים, ולפני שמפיצים אותו במוצר מסחרי סגור כדאי לוודא שהסטטוס מול היוצרים ברור.

הרישיון המלא בעמוד המודל ↗