GPT
G

GLM-5.2-colibri-int4-with-int8-mtp

קוד פתוח

mateogrgicmit2026-07-10

  • glm_moe_dsa
  • int4
  • cpu
  • moe
  • expert-streaming

גרסה מכווצת של GLM-5.2 שמיועדת להרצה על מעבד רגיל במקום על שרת כרטיסי מסך. מי שרוצה אותו מחפש את שילוב הראשים הייחודי שמאיץ את התגובה בעזרת פענוח ספקולטיבי.

  • 1,048,576טוקנים בהקשר
  • 357 GBמשקל הקבצים
  • 366הורדות בחודש
  • 138לייקים

מה זה

המשקל הזה מבוסס על GLM-5.2 שהומר לפורמט של מנוע colibri בכימות של 4 ביט. השינוי היחיד מול גרסאות דומות ברשת הוא שראשי ה־MTP נשמרו ב־8 ביט, כי בכימות של 4 ביט אחוז הקבלה שלהם צנח והם היו חסרי תועלת. המשמעות המעשית היא שהפענוח הספקולטיבי באמת מייצר האצה מורגשת בזמן יצירת הטקסט.

המודל כולל ארכיטקטורת תערובת מומחים עם 78 שכבות ותומך רשמית באנגלית וסינית. הוא מחזיק הקשר עצום של מעל מיליון טוקנים, אבל בגלל מבנה הקבצים וההסתמכות על מנוע הרצה ספציפי, הוא מיועד בעיקר למי שמחפש לעקוף את צוואר הבקבוק של זיכרון גרפי יקר.

מתאים ל

  • הרצה מקומית ללא GPU

    מאפשר להריץ מודל ענק ישירות על מעבד וכונן NVMe מהיר במערכות שאין בהן כרטיסי מסך יקרים.

  • עיבוד מסמכים ארוכים

    מתאים לניתוח טקסטים באנגלית או סינית בזכות חלון הקשר של מיליון טוקנים.

  • הסקה מואצת על מעבד

    משתמש בראשי MTP בכימות 8 ביט שמאפשרים פענוח ספקולטיבי תקין ומקצרים זמני תגובה.

איפה זה נופל

הקובץ הזה לא יעבוד עם Ollama, llama.cpp, vLLM, AWQ, MLX או כל כלי סטנדרטי אחר שאתם רגילים אליו, אלא אך ורק עם המנוע colibri. בנוסף, המודל אומן על אנגלית וסינית בלבד, כך שאין כאן התאמה או הבטחה ליכולות בעברית. ראשי ה־MTP בגרסת 4 ביט המקורית היו לא שמישים, וגם אחרי התיקון ל־8 ביט, ביצועי ההרצה על מעבד תלויים לחלוטין במהירות הכונן המקומי.

שאלות
נפוצות

אפשר להריץ את המודל הזה עם llama.cpp או vLLM?

לא. המשקלים האלה נבנו אך ורק עבור מנוע colibri ואינם תואמים ל־GGUF, AWQ, GPTQ או ספריות נפוצות אחרות. אם תורידו אותו בלי לקמפל את המנוע הייעודי, לא תוכלו לטעון אותו.

האם המודל יפעל טוב בעברית?

הנתונים הרשמיים מציינים תמיכה באנגלית ובסינית בלבד. הוא עשוי לפלוט מילים בעברית אם נתקל בהן באימון, אבל אי אפשר להסתמך עליו למשימות ייצור בשפה הזו.

למה הראשים נשמרו ב־8 ביט ולא ב־4 ביט כמו שאר המודל?

היוצר מסביר שבכימות 4 ביט ראשי ה־MTP סבלו מאחוזי קבלה נמוכים מאוד בפענוח ספקולטיבי והפכו למיותרים. העלאת הדיוק ל־8 ביט מחזירה את ההאצה בלי להגדיל משמעותית את הנפח הכולל.

איך מריצים

כדי להריץ אותו צריך להוריד ולקמפל את מנוע colibri ב־C עם תמיכה ב־OpenMP ו־AVX2 על לינוקס או WSL2. תצטרכו לפחות 16 גיגה זיכרון עבודה וכונן NVMe מהיר עם לפחות 400 גיגה פנויים, כי מדובר ב־357 גיגה שמחולקים ל־150 קבצים.

ההרצה מתבצעת על המעבד ישירות דרך הכונן באמצעות הפקודה coli chat. אם אין לכם כונן מהיר במיוחד או סבלנות להתעסק עם מנוע לא מוכר ב־C, עדיף בהרבה להשתמש ב־API מרוחק במקום לנסות לדחוף מאות גיגות של קבצים מקומית.

pip install -U huggingface_hub
hf download mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp

הרישיון

המודל מופץ תחת רישיון MIT, שמגיע ישירות ממודל המקור וההמרה. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו בקוד סגור, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗