GPT
G

GLM-5.2-colibri-int4-g64-with-int8-mtp

קוד פתוח

mastourimit2026-07-17

  • glm_moe_dsa
  • colibri
  • glm
  • glm-5.2
  • glm-5

המודל הזה מכווץ ענק של 744 מיליארד פרמטרים להרצה מקומית באמצעות קוונטיזציה חכמה. הוא פותר בעיות איכות וחזרתיות שאפיינו המרות קודמות בלי לדרוש שרת ייעודי של מאות אלפי שקלים.

  • 1,048,576טוקנים בהקשר
  • 400 GBמשקל הקבצים
  • 5,108הורדות בחודש
  • 69לייקים

מה זה

מדובר בהמרה של GLM-5.2 עבור מנוע ההזרמה colibri, המבוססת על מודל MoE עם 78 שכבות וחלון הקשר של מעל מיליון טוקנים. הייחוד כאן הוא שימוש בסקלות מקובצות לפי 64 ערכים במקום סקלה לכל שורה, יחד עם ראש חיזוי מסוג MTP בפורמט int8 שמניב קבלת טיוטות בשיעור 39 עד 59 אחוזים. השינוי הזה תופס עוד 12 אחוזים בנפח האחסון, אבל מונע מאי דיוקים נקודתיים להרוס שורות שלמות.

בבדיקות עצמאיות המבנה הזה הציג דיוק מנורמל של 87.0 אחוזים בבנצ'מרק hellaswag מול 83.5 אחוזים בגרסת ה־int4 הרגילה. המשמעות המעשית היא שהמודל עוצר בזמן במקום להיתקע בלולאות חשיבה אינסופיות שלא מגיעות לטוקן סיום. הוא מאפשר לייצר טקסט ארוך ואמין גם בהגדרות דגימה גבוהות שבעבר שברו לחלוטין את הפלט.

מתאים ל

  • עיבוד אצווה לטקסטים ארוכים

    חלון הקשר עצום מאפשר ניתוח מסמכים שלמים במחשב מקומי, כל עוד זמן הריצה אינו קריטי.

  • מחקר והערכת מודלי ענק

    בדיקת יכולות של מודל עם 744 מיליארד פרמטרים על חומרת צרכנים בלי לשלם על שרתי ענן יקרים.

  • סביבות פיתוח מנותקות רשת

    הרצה מקומית של יכולות שיח והסקה מתקדמות בארגונים שמונעים גישה לשירותי API חיצוניים.

איפה זה נופל

המהירות כאן היא המכשול העיקרי. על מחשב אישי טיפוסי עם כרטיס בודד של 16 גיגה וזיכרון מוגבל תקבלו קצב מזדחל של 0.3 עד 1.4 טוקנים לשנייה, וזה לא מתאים לשום שירות שדורש מענה בזמן אמת. בנוסף, חובה להפעיל ידנית את הדגל THINK=1, אחרת המנוע שותל תגיות חשיבה סגורות והתשובות הופכות שטחיות לחלוטין. הפעלת מנגנוני ניחוש כמו MTP על כונן אחסון רק תאט את הביצועים בעד 52 אחוזים בגלל פניות מרובות לדיסק.

שאלות
נפוצות

האם כדאי להפעיל MTP כדי להאיץ את קצב הייצור?

לא אם אתם קוראים את המומחים מכונן NVMe. במערכת כזו ניחוש טוקנים מרחיב את כמות המומחים הדרושים בכל ריצה, מפיל את אחוז הדיוק מהזיכרון ומוריד את המהירות בחצי. המנגנון משתלם רק אם כל המשקלים יושבים במלואם בזיכרון המחשב.

למה המודל נותן תשובות מטופשות לשאלות מורכבות?

ברוב המקרים שכחתם להגדיר THINK=1 בהפעלת התוכנה. ללא הדגל הזה, המנוע סוגר מראש את תגית החשיבה בהנחיה, והמודל עונה מהבטן בלי להפעיל מנגנוני היגיון.

האם עדיף להקצות יותר VRAM למומחים על כרטיס של 16 גיגה?

לא, זו טעות נפוצה שרק פוגעת בביצועים. עדיף לשמור את ה־VRAM לשכבות הצפופות שמופעלות בכל טוקן, ולהשאיר את הגישה למומחים לזיכרון הראשי כדי לא לחנוק את המערכת.

איך מריצים

בפועל אתם מורידים 400 גיגה של קבצים ומריצים אותם על מנוע colibri מגרסה 1.5.0 ומעלה, שכוללת תיקוני אבטחה קריטיים לקריאת קבצים חיצוניים. חובה להחזיק כונן NVMe מהיר באותו נפח, או לפצל את הקבצים לכמה כוננים באמצעות הגדרת COLI_MODEL_DIRS, לצד לפחות 16 גיגה זיכרון RAM כשבפועל 128 גיגה מומלצים כדי להגיע למהירות של כ־1.3 טוקנים לשנייה. כרטיס מסך עם 16 גיגה VRAM מספיק לשכבות הצפופות ולמאגר מומחים מצומצם.

אם כל המומחים נכנסים לכם לזיכרון הגרפי, הגרסה הזו עדיפה בביצועים על גרסת ה־E8 המקבילה. מנגד, אם אתם לא מחזיקים מחשב קצה חזק וסבלנות לקצב ייצור אטי, עדיף בהרבה לפנות ל־API מסחרי שמארח את המודל המקורי.

pip install -U huggingface_hub
hf download mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp

הרישיון

הרישיון כאן הוא MIT רגיל. אתם יכולים להשתמש בקבצים לצרכים פרטיים ומסחריים, לשנות אותם ולהפיץ אותם בתוך מוצרים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והפטור מאחריות המצורפים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗