GPT
G

GLM-4.5-Air-FP8

קוד פתוח

zai-orgmit2025-07-20

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • agentic

גרסה מכווצת של מודל תערובת מומחים שמיועדת להפעלת סוכנים עצמאיים. הוא מאפשר חשיבה מעמיקה לצד שימוש בכלים ודורש פחות כוח חישוב מאחיו הגדול.

  • 111Bפרמטרים
  • 131,072טוקנים בהקשר
  • 105 GBמשקל הקבצים
  • 76,412הורדות בחודש

מה זה

מדובר במודל שפה מסוג תערובת מומחים עם מאה ושישה מיליארד פרמטרים בסך הכול, כאשר רק שנים עשר מיליארד מהם פעילים בכל טוקן. המבנה הזה נותן לו לרוץ מהר יחסית לגודל שלו. הוא כולל שני מצבי עבודה, מצב חשיבה שמפרק בעיות מורכבות ומפעיל כלים חיצוניים, ומצב רגיל שמחזיר תשובות מהירות בלי שרשרת מחשבה.

במבחני ביצועים רוחביים על פני שנים עשר מדדים מקובלים הוא קיבל ציון של 59.8, מול 63.2 של הגרסה המלאה בת 355 מיליארד הפרמטרים. הפער קטן יחסית, מה שמראה שהכיווץ לגרסת האייר שמר על רוב יכולות ההיגיון והקוד למרות הירידה הניכרת במשאבים.

מתאים ל

  • סוכני קוד ואוטומציה

    תמיכה מובנית בקריאת כלים בפורמט של OpenAI ומנגנון פירוק בעיות מתאים להרצת תהליכים אוטונומיים.

  • עיבוד מסמכים ארוכים

    חלון הקשר של מאה עשרים ושמונה אלף טוקנים מתאים לניתוח מעמיק של תיעוד טכני נרחב או קבצי קוד שלמים.

  • תרגום ועיבוד דו־לשוני

    התמחות באנגלית וסינית הופכת אותו לכלי עבודה ישיר למערכות שפועלות בין שני השווקים האלה.

איפה זה נופל

המודל אומן ותומך רשמית רק באנגלית ובסינית, כך שאי אפשר לבנות עליו לעיבוד שפות אחרות בלי אימון מקדים. בנוסף, למרות הדחיסה לשמונה ביט, דרישת הזיכרון של השרת המארח נשארת עצומה ומחייבת מעל טרה בייט ראם, מה שחוסם מיד מכונות ענן סטנדרטיות ומשאיר אותו מחוץ להישג ידם של צוותים קטנים.

אותה משפחה

GLM-4.5-Air יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת ביתי או מחשב פיתוח חזק?

לא. גם בגרסת השמונה ביט צריך כרטיסי שרת מקצועיים כמו H100 ומעל טרה בייט זיכרון מערכת רק בשביל הטעינה. חומרה צרכנית לא תצליח להחזיק אותו.

איך מבטלים את זמן ההמתנה של מצב החשיבה?

ברירת המחדל מפעילה חשיבה בכל תשובה. כדי לקבל מענה מיידי שולחים בפרמטרים של הבקשה כיבוי של המצב דרך הגדרות תבנית השיחה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־105 ג'יגה בייט בפורמט שמונה ביט. כדי להריץ אותו בהספק בסיסי של עד שמונה פניות במקביל צריך לפחות כרטיס H200 יחיד או שני כרטיסי H100, יחד עם שרת שמכיל מעל טרה בייט של זיכרון עבודה כדי לטעון את המשקלים. אם תרצו לנצל את מלוא חלון ההקשר של מאה עשרים ושמונה אלף טוקנים, תצטרכו לעלות לשני H200 או ארבעה H100.

ההרצה המקומית נתמכת דרך ספריות כמו SGLang ו־vLLM עם מפענחים ייעודיים לקריאות כלים וחשיבה. למי שאין אשכול שרתים ייעודי בענן בעלויות של אלפי דולרים, עדיף בהרבה להשתמש ב־API הרשמי של היוצרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.5-Air-FP8")
print(pipe("שלום"))

הקבצים

55 קבצים במאגר, 105 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר ברישיון MIT מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לבצע פיתוחי המשך ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗