GPT
G

GLM-5

קוד פתוח

zai-orgmit2026-02-11

  • transformers
  • safetensors
  • glm_moe_dsa
  • text-generation
  • conversational

מפלצת קוד פתוח עם 754 מיליארד פרמטרים שמכוונת ישירות למשימות פיתוח מורכבות והרצת סוכנים אוטונומיים. מי שיבחר בה מחפש יכולות ברמה של המודלים המובילים, אבל עם שליטה מלאה במשקלים.

  • 754Bפרמטרים
  • 202,752טוקנים בהקשר
  • 1.4 TBמשקל הקבצים
  • 62,763הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים עם ארכיטקטורת GlmMoeDsaForCausalLM, שמפעיל 40 מיליארד פרמטרים בכל שלב מתוך 754 מיליארד בסך הכל. ההבדל המרכזי מול הדור הקודם הוא שילוב של מנגנון קשב דליל בשם DeepSeek Sparse Attention, שנועד לאפשר עבודה עם חלון הקשר ענק של 202,752 טוקנים בלי לחנוק את החומרה לחלוטין. האימון התבסס על 28.5 טריליון טוקנים ותשתית למידת חיזוק אסינכרונית בשם slime, שנועדה לדחוף את ביצועי החשיבה קדימה.

במבחני ביצועים הוא עומד ראש בראש עם המודלים הקנייניים הכי חזקים. במבחן הקוד SWE-bench Verified הוא מגיע ל־77.8 אחוזים, קרוב מאוד למובילי השוק, ובמשימות טרמינל וסוכנים כמו Terminal-Bench 2.0 הוא רושם 56.2 נקודות ומגיע עד 61.1 בגרסה המתוקנת, תוצאה שמקבילה או עוקפת את רוב המתחרים. במבחן AIME 2026 הוא משיג 92.7, מה שמראה יכולת פתרון בעיות מתמטיות ברמה קיצונית.

מתאים ל

  • סוכני פיתוח תוכנה

    תוצאה של 77.8 אחוז ב־SWE-bench Verified הופכת אותו למתאים במיוחד לכתיבת קוד עצמאית ותיקון באגים במאגרים גדולים.

  • הרצת פקודות טרמינל

    ציונים של מעל 60 ב־Terminal-Bench מאפשרים לו לתפעל סביבות פיתוח וקונפיגורציות שרתים מורכבות בצורה אוטונומית.

  • פתרון בעיות מתמטיות

    עם 92.7 ב־AIME ו־96.9 ב־HMMT, הוא מתאים למשימות חישוביות שמחייבות שרשראות חשיבה ארוכות ומדויקות.

איפה זה נופל

המודל אומן והוגדר רשמית רק עבור אנגלית וסינית, כך שאי אפשר להסתמך עליו לעיבוד עברית בצורה עקבית או מדויקת. במשימות מסוימות כמו Tool-Decathlon הוא משיג רק 38 אחוזים, ובמבחן אבטחת המידע CyberGym הוא עומד על 43.2 אחוז בלבד, שזה נמוך משמעותית מחלק מהמתחרים המובילים. בנוסף, למרות מנגנון הקשב היעיל, החזקת הקשר מלא של מעל 200 אלף טוקנים דורשת משאבי חישוב עצומים ועלולה להיתקל בצווארי בקבוק חריפים בהרצה עצמאית.

אותה משפחה

GLM-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת יחיד עם שמונה כרטיסי GPU רגילים?

לא בקלות. המשקלים לבדם תופסים 1.4 טרה-בייט, כך שגם בחלוקה ל־8 מאיצים נדרש נפח זיכרון עצום של מעל 160 גיגה-בייט לכרטיס רק כדי לטעון אותו, עוד לפני חישוב ה־KV cache לחלון הקשר ארוך. תצטרכו שרתים עתירי VRAM או מעבר לפתרונות מבוססי שרת מרובה צמתים וכימות.

איך המודל מתמודד עם השפה העברית?

כרטיס המודל מציין תמיכה באנגלית ובסינית בלבד. הוא עשוי לייצר עברית ברמה מסוימת מתוך דאטה כללי ברשת, אך הביצועים צפויים להיות נמוכים, מקוטעים ולא מתאימים לעבודה בסביבת ייצור בלי אימון ייעודי.

איך מריצים

במשקל כולל של 1.4 טרה-בייט שמחולק ל־300 קבצים, אין פה שום אפשרות להרצה על תחנת עבודה רגילה. כדי להרים מופע עצמאי עם vLLM או SGLang תצטרכו שרת עם מקביליות טנסורית של לפחות 8 מאיצים עתירי זיכרון, וגם אז תידרש תמיכה בקרנלים ייעודיים עבור מנגנון הקשב הדליל כדי לסחוט ביצועים שפויים.

יש תמיכה רשמית בהרצה מקומית דרך ספריות כמו KTransformers, xLLM על מעבדי Ascend ו־transformers הרגילה. עם זאת, אלא אם אתם ארגון שמחזיק אשכול שרתים ייעודי וחייב את המידע מאחורי חומת אש, הדרך ההגיונית והכלכלית להשתמש בו היא פשוט לשלם פר קריאה בפלטפורמת ה־API של Z.ai.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-5")
print(pipe("שלום"))

הקבצים

300 קבצים במאגר, 1.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לכל מטרה, כולל שימוש מסחרי, שינוי המשקלים והטמעה במוצרים סגורים, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗