GPT
G

GLM-5.2-colibri-int4

קוד פתוח

jlnsrkmit2026-07-06

  • glm_moe_dsa
  • int4
  • cpu
  • moe
  • expert-streaming

גרסת int4 מוכנה מראש למודל ענק של 744 מיליארד פרמטרים. היא נועדה להרצה על מחשב אישי בלי לקנות כרטיסי מסך יקרים, בזכות הזרמת משקלים מהדיסק.

  • 1,048,576טוקנים בהקשר
  • 353 GBמשקל הקבצים
  • 8,440הורדות בחודש
  • 164לייקים

מה זה

מדובר במודל MoE עצום שמכיל 21,504 מומחים מנותבים, אבל בגרסה הזו מכווץ לפורמט ייעודי שמתאים אך ורק למנוע colibrì הכתוב ב־C. במקום להוריד 756 גיגה בייט בפורמט FP8 ולשרוף יום שלם על המרה מקומית, הקבצים כאן כבר ארוזים ומותאמים ישירות לקרנלים של המנוע.

הייחוד האמיתי הוא היכולת לפעול מתוך זיכרון RAM צנוע מאוד למודל בגודל כזה, על ידי טעינת המומחים בזמן אמת מכונן מהיר. החבילה כוללת גם את ראש ה־MTP שמאפשר speculative decoding מובנה של בערך שני טוקנים בכל מעבר, ומחזיקה חלון הקשר עצום של מעל מיליון טוקנים, כאשר שפות העבודה המוצהרות הן אנגלית וסינית בלבד.

מתאים ל

  • הרצה מקומית של מודל ענק

    מאפשר לבדוק מודל של 744B על תחנת עבודה רגילה עם 16 או 25 גיגה זיכרון, בלי להחזיק שרת GPU ייעודי.

  • עיבוד מסמכים ארוכים

    מתאים לטקסטים ענקיים באנגלית או סינית בזכות חלון הקשר של מיליון טוקנים, בלי עלויות של ספקי ענן.

  • סביבות פיתוח מנותקות

    פיתוח ובדיקות על מודל מתקדם במערכות סגורות לחלוטין שאין להן גישה לשירותי רשת חיצוניים.

איפה זה נופל

הקבצים לא תואמים לשום כלי מוכר חוץ ממנוע colibrì. ביצועי המהירות תלויים לחלוטין במהירות הקריאה של ה־NVMe שלכם, כך שצוואר הבקבוק הוא הדיסק ולא המעבד. בנוסף, המודל אומן רק על אנגלית וסינית, כך שאין שום הבטחה או בדיקה לגבי עברית, וסביר להניח שהיא תישבר או תייצר פלט עילג.

שאלות
נפוצות

אפשר להריץ את הקבצים האלה עם Ollama או LM Studio?

לא. הקבצים האלה אינם GGUF ולא נתמכים בכלים הסטנדרטיים. הדרך היחידה להריץ אותם היא להוריד ולקמפל את מנוע colibrì ב־C לפי ההנחיות של הפרויקט.

האם כונן SSD רגיל או דיסק רשת יספיקו להרצה הזו?

ממש לא. המנוע מזרים אלפי מומחים ישירות מהאחסון לזיכרון בכל טוקן, וחייב כונן NVMe מהיר שמחובר מקומית עם מערכת קבצים ext4. על כונן איטי או חיבור רשת המערכת תזחל או תיעצר.

איך מריצים

כדי להריץ אותו צריך לינוקס או WSL2, מעבד שתומך ב־AVX2 עם OpenMP, לפחות 16 גיגה זיכרון RAM, ומעל הכל כונן NVMe מקומי ומהיר מאוד עם 400 גיגה פנויים ומערכת קבצים ext4. שום כונן רשת לא יעבוד פה בגלל קצב ההזרמה הנדרש. מורידים את המנוע מגיטהאב, מקמפלים, ומריצים את פקודת הצ'אט שמזהה לבד את הזיכרון.

זה לא פורמט GGUF, לא AWQ ולא עובד ב־Ollama או vLLM. אם אין לכם כונן NVMe פנוי ומהיר במיוחד שמחובר ישירות ללוח, חבל על הזמן של ההורדה, ועדיף לשלם לפי טוקן ל־API מרוחק.

pip install -U huggingface_hub
hf download jlnsrk/GLM-5.2-colibri-int4

הרישיון

הרישיון הוא MIT, בדיוק כמו מודל המקור. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במוצרים ולהפיץ אותו חופשי, בלי תמלוגים ובלי חובת שיתוף קוד, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗