GPT
G

GLM-4.5-Air

קוד פתוח

zai-orgmit2025-07-20

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • conversational

גרסת MoE קומפקטית שמפעילה רק 12 מיליארד פרמטרים בכל שלב מתוך 110 בסך הכול. פתרון ממוקד סוכנים אוטונומיים עם תמיכה בחשיבה עמוקה והפעלת כלים.

  • 110Bפרמטרים
  • 131,072טוקנים בהקשר
  • 206 GBמשקל הקבצים
  • 112,541הורדות בחודש

מה זה

מדובר במודל שמכוון ישירות לבניית סוכנים, כתיבת קוד והסקה לוגית מורכבת. הייחוד שלו מול מודלים צפופים רגילים בגודל הזה טמון בארכיטקטורת תערובת המומחים. במקום להעמיס את כל 110 מיליארד הפרמטרים בכל טוקן, הוא מנתב את החישוב ומפעיל רק 12 מיליארד, מה שמספק מהירות תגובה גבוהה בהרבה לצד קיבולת ידע רחבה.

הוא כולל שני מצבי עבודה מוגדרים: מצב חשיבה שמתאים לפתרון בעיות סבוכות, תכנות והפעלת כלים חיצוניים, ומצב רגיל שמחזיר תשובות ישירות בלי שרשרת מחשבה ארוכה. במבחני ביצועים מול 12 מדדים מקובלים בתעשייה הוא הוציא ציון של 59.8, תוצאה קרובה מאוד לגרסה המלאה שלו שמגיעה לציון 63.2 עם 355 מיליארד פרמטרים.

מתאים ל

  • סוכנים מבוססי כלים

    מצב החשיבה והפרסר המובנה מאפשרים פירוק משימות וקריאה מדויקת ל־APIs חיצוניים.

  • עבודה עם מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר לעבד קבצי קוד שלמים ומסמכים טכניים בלי קיטוע.

  • יצירת קוד והסקה לוגית

    ארכיטקטורת ה־MoE מציעה ביצועים תחרותיים במשימות פיתוח עם עלות חישוב של 12B בלבד.

איפה זה נופל

השפות הרשמיות שנתמכות בכרטיס המודל הן אנגלית וסינית בלבד. אין שום התחייבות ליכולות בעברית, ולפני שבונים עליו מוצר מקומי צריך לבדוק אם הוא בכלל מבין את השפה ברמה סבירה ולא מייצר ג'יבריש. בנוסף, חלון ההקשר העצום של 131,072 טוקנים דורש כמות אדירה של זיכרון עבודה מעבר למשקלי המודל עצמם, כך שניצול מלא שלו בשרת פרטי יחייב משאבים כבדים מאוד.

אותה משפחה

GLM-4.5-Air יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך בודד?

לא בגרסה הזו. הקבצים שוקלים 206GB ודורשים שרת עם מספר מאיצים מתקדמים. גם גרסת ה־FP8 המכווצת תדרוש חומרה ברמת תחנת עבודה ארגונית לפחות.

איך המודל מתמודד עם עברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. ייתכן שהוא יבין מילים בסיסיות, אבל לשימוש רציני בעברית צריך לבחון אותו בזהירות או לבחור מודל עם אימון ייעודי.

איך מריצים

כדי להריץ 206 ג'יגה בייט של משקלים בפורמט bfloat16 תצטרכו שרת עם לפחות ארבעה כרטיסי A100 או H100 של 80GB. הקוד נתמך ישירות בספריות transformers, vLLM וגם SGLang, שמציעות יישום מובנה למבנה ה־MoE ולפרסור הפעלת הכלים. קיימת גם גרסת FP8 מכווצת שמקילה משמעותית על נפח הזיכרון הנדרש.

אם אין לכם קלאסטר שרתים ייעודי שרץ סביב השעון, עדיף בהרבה להשתמש ב־API המנוהל של z.ai או Zhipu AI. החזקת חומרה כזו בשביל ניסויים ראשוניים תעלה לכם יותר מאשר צריכת מיליוני טוקנים בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.5-Air")
print(pipe("שלום"))

הקבצים

55 קבצים במאגר, 206 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. מותר לעשות איתו כמעט הכל, כולל שימוש מסחרי חופשי, שינויים והפצה מחדש בתוך מוצרים סגורים, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗