GPT
G

GLM-4.5

קוד פתוח

zai-orgmit2025-07-20

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • conversational

מודל ענק בתצורת תערובת מומחים שמיועד לסוכנים אוטונומיים ומשימות חשיבה מורכבות. הוא מציע שילוב מובנה של הסקת מסקנות, תכנות והפעלת כלים תחת רישיון פתוח לחלוטין.

  • 358Bפרמטרים
  • 131,072טוקנים בהקשר
  • 667 GBמשקל הקבצים
  • 80,274הורדות בחודש

מה זה

מדובר במודל שפה עם 355 מיליארד פרמטרים בסך הכול, אך בכל פעולת חיזוי מופעלים רק 32 מיליארד פרמטרים. הארכיטקטורה הזו נועדה לתת עומק של מודל ענק מבלי לשלם את מלוא מחיר החישוב בכל טוקן. המערכת כוללת שני מצבי עבודה, מצב חשיבה מעמיק שמנתח בעיות מורכבות ומפעיל כלים חיצוניים, ומצב ישיר לתשובות מהירות ללא שרשרת מחשבה.

לפי המבחנים של המפתחים ב־12 מדדים מקובלים, הוא קיבל ציון של 63.2 והגיע למקום השלישי מול שאר המודלים המסחריים והפתוחים שנבדקו. השילוב הזה הופך אותו לאלטרנטיבה מעניינת למי שרוצה יכולות של מודל קנייני כבד בסביבה עצמאית, במיוחד אם המטרה היא בניית סוכנים שמבצעים אוטומציות מרובות שלבים.

מתאים ל

  • סוכנים אוטונומיים

    תמיכה מובנית בפיענוח קריאות לכלים ובמצב חשיבה שמתאים לביצוע פעולות רב־שלביות.

  • תכנות ופתרון באגים

    מצב החשיבה מאפשר ניתוח מעמיק של לוגיקה מורכבת לפני כתיבת קוד סופי.

  • אימון ועידון מקומי

    רישיון MIT מאפשר לבצע LoRA על נתונים פנימיים בארגון ללא מגבלות הפצה.

איפה זה נופל

הנתונים הרשמיים מתמקדים רק באנגלית ובסינית, כך שאין שום הבטחה או בדיקה לגבי איכות הפלט בעברית. משקל הקבצים עומד על 667 גיגה־בייט, גודל שמקשה מאוד על תעבורת רשת, זמני טעינה וגיבויים. בנוסף, מימוש של 128K טוקנים דורש חומרת קצה קיצונית, ובמכונות סטנדרטיות יותר תוגבלו לעבודה עם זיכרון קצר בהרבה כדי לא לחרוג מנפח ה־VRAM.

אותה משפחה

GLM-4.5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל המלא על שרת ענן צנוע?

לא. המודל דורש שרת עם לפחות 1 טרה־בייט זיכרון RAM וסוללה של 8 עד 16 מאיצי H100 רק כדי להיטען ולענות. אם התקציב או הציוד מוגבלים, שווה לבדוק את גרסת GLM-4.5-Air שמסתפקת בפחות משאבים.

איך מבטלים את זמן החשיבה בתשובות פשוטות?

בשימוש דרך vLLM או SGLang מועבר פרמטר בתוך גוף הבקשה שמכבה את אפשרות ה־thinking. במצב הזה המודל עונה מיד ללא שלב פנימי של פתרון בעיות, מה שמקצר את זמן התגובה במשימות טקסט שגרתיות.

איך המודל מתמודד עם טקסט בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא עשוי לקלוט עברית ברמה בסיסית, אבל ללא תמיכה מוגדרת יש סיכון גבוה להזיות, תחביר משובש או שימוש לא יעיל בטוקנים.

איך מריצים

כדי להריץ את גרסת ה־BF16 המלאה צריך שרת עם לפחות טרה־בייט זיכרון פנימי, ו־16 כרטיסי H100 או 8 כרטיסי H200. אם רוצים לנצל את מלוא חלון ההקשר של 128K טוקנים, הדרישה מזנקת ל־32 כרטיסי H100. יש גם גרסת FP8 שמקצצת את דרישות החומרה בחצי, לצד גרסת Air קטנה בהרבה עם 12 מיליארד פרמטרים פעילים שרצה על שני כרטיסי H100.

ההרצה המקומית נתמכת דרך transformers, vLLM ו־SGLang. לרוב המפתחים והצוותים אין גישה לאשכולות חומרה במאות אלפי דולרים רק בשביל הרצת מודל בודד, ולכן הגיוני בהרבה להשתמש ב־API המסחרי של Z.ai או Zhipu AI במקום לתחזק שרתים כאלה בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.5")
print(pipe("שלום"))

הקבצים

101 קבצים במאגר, 667 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות פשוטה וישירה, מותר להשתמש בו לצרכים מסחריים, לבצע התאמות, לפתח מוצרים נגזרים ולהריץ אותו בכל תשתית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗