GPT
T

Ternary-Bonsai-1.7B-gguf

קוד פתוח

prism-mlapache-2.02026-04-18

  • gguf
  • ternary
  • 1.58-bit
  • llama-cpp
  • q2_0

גרסה מכווצת של קוון 3 ששוקלת פחות מחצי גיגה ורצה ישירות מהמעבד. פתרון מתאים למי שחייב מודל מקומי על חומרה חלשה בלי לשלם על שרת ייעודי.

  • 4.5 GBמשקל הקבצים
  • 5,752הורדות בחודש
  • 44לייקים

מה זה

המודל הזה לוקח את Qwen3-1.7B וממיר את המשקולות שלו לערכים טרנאריים של מינוס אחת, אפס ופלוס אחת. הקידוד הזה דוחס את כל הרשת לקובץ של 442 מגה בפורמט Q2_0, במקום 3.44 גיגה בבסיס המקורי. הפורמט הזה תופס שתי סיביות לכל משקל, ולפי בדיקות ההתכנסות של החברה הוא שומר על התנהגות כמעט זהה למודל המקורי בלי לאבד דיוק מורגש ביחס לרמת הבסיס שלו.

במבחני ביצועים המודל משיג ציון ממוצע של 58.47 נקודות, לעומת 66.57 של המודל המקורי הלא מכווץ. הוא מאבד כוח בעיקר במשימות של קריאות לפונקציות עם 51 נקודות לעומת 71.8 במקור, ובמתמטיקה עם 74.2 לעומת 83.1. מנגד, הוא עדיין עוקף דגמים מתחרים בגודל של גיגה עד שני גיגה כמו Llama 3.2 1B שקיבל כמעט 40 נקודות או Gemma3 1B שעומד על 45.5 נקודות.

מתאים ל

  • עיבוד טקסט במכשירי קצה

    הוא שוקל 442 מגה בלבד ורץ מהר על מעבדים פשוטים בלי צורך בכרטיס מסך ייעודי.

  • מיון ותיוג מקומי

    מבנה ה־IFEval שלו עומד על 70.1 נקודות, רמה שמספיקה להבנת הוראות קצרות ולסיווג טקסט.

  • שירותים ללא חיבור רשת

    הנפח הקטן מאפשר להתקין אותו בתוך אפליקציה סגורה או מחשב מבודד בלי להעמיס על האחסון.

איפה זה נופל

הנפילה הגדולה של המודל היא במשימות מורכבות של קריאת כלים ופונקציות, שם הציון צונח ביותר מעשרים נקודות ביחס למודל הבסיס. היכולת הלוגית והמתמטית שלו נפגעת גם היא בגלל הדחיסה הקיצונית. בנוסף, חלון ההקשר תומך אמנם בעד 32,768 טוקנים, אבל שימוש בהקשר ארוך מעמיס על הזיכרון ומבטל חלק מיתרון הגודל. חובה לבדוק אותו מראש על משימות הניסוח והחילוץ שלכם, כי הוא לא מחזיק הסקת מסקנות עמוקה.

אותה משפחה

Ternary-Bonsai יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות בגרסה הרשמית של llama.cpp?

לא ברגע זה. התמיכה בפורמט Q2_0 עבור המודל נמצאת כרגע רק בענף נפרד במאגר של Prism ML, ויש לקמפל אותו משם עד שהשינויים יוטמעו בפרויקט הראשי.

כמה זיכרון עבודה צריך בפועל כדי להריץ את המודל?

הקובץ המומלץ שוקל כ־442 מגה, כך שגם עם חישובי הקשר קצרים תצטרכו פחות מגיגה אחד של זיכרון פנוי. זה מאפשר להריץ אותו אפילו על מחשבים ישנים או מעבדים חלשים.

איך מריצים

כדי להריץ אותו צריך למשוך ענף ייעודי מפיצול של llama.cpp שפתחו בגיטהאב של החברה, כי התמיכה בקרנל של Q2_0 עדיין לא נכנסה לקוד הרשמי. מקמפלים את הפרויקט עם תמיכה במטאל או קוּדָה ומריצים דרך ממשק הפקודה או כשרת מקומי. קובץ ה־Q2_0 שוקל 442 מגה, כך שהוא נכנס בקלות לכל מחשב נייד או מעבד עם מעט זיכרון פנימי.

בבדיקות של החברה על שבב M4 Pro הוא מגיע לקצב של 229 טוקנים בשנייה על המאיץ הגרפי ו־123 טוקנים בשנייה על המעבד בלבד עם עשרה תהליכים. אם אין לכם שליטה על תהליך ההתקנה או צורך במודל מנותק רשת, עדיף להשתמש ב־API מרוחק של מודל מלא. ההתעסקות בגרסת פיתוח של ספרית הרצה שווה את המאמץ רק כשרוצים לחסוך עלויות תשתית.

ollama run hf.co/prism-ml/Ternary-Bonsai-1.7B-gguf:Ternary-Bonsai-1.7B-PQ2_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. אין חובה לחשוף את הקוד שלכם, אך נדרש לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗