GPT
G

GLM-4.5-FP8

קוד פתוח

zai-orgmit2025-07-20

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • moe

מודל ענק בתצורת MoE שמיועד לפיתוח סוכנים אוטונומיים ומשימות תכנות מורכבות. הוא מאפשר מעבר בין חשיבה מעמיקה לפני מענה לבין תשובה ישירה, בגרסה מכווצת שכבר מגיעה בקוונטיזציה של שמונה ביט.

  • 358Bפרמטרים
  • 131,072טוקנים בהקשר
  • 337 GBמשקל הקבצים
  • 1,318הורדות בחודש

מה זה

מדובר במודל MoE עם 355 מיליארד פרמטרים בסך הכול, שמפעיל 32 מיליארד פרמטרים בכל טוקן. המטרה המרכזית שלו היא לפתור בעיות מורכבות של סוכנים אוטונומיים, חשיבה מרובת שלבים וכתיבת קוד. המודל תומך בשני מצבי עבודה, מצב חשיבה שבו הוא מייצר שרשרת היסק ומפעיל כלים, ומצב רגיל שפולט תשובות מיד ללא שלב מקדים.

במבחני ביצועים הוא הגיע לציון של 64.2% בבנצ׳מרק SWE-bench Verified ו־70.1% ב־TAU-Bench, מה שמעיד על דיוק גבוה מאוד בפתרון באגים אמיתיים בקוד ובתפעול סביבות מרובות שלבים. לפי הנתונים בכרטיס, הוא מציג שילוב שמתחרה ישירות במודלים המובילים בעולם במשימות של הפעלת כלים, תוך צריכת משאבים של מודל קטן בהרבה בזמן ריצה בזכות הארכיטקטורה המבוזרת שלו.

מתאים ל

  • סוכני תכנות אוטונומיים

    תוצאה של 64.2% ב־SWE-bench Verified הופכת אותו למתאים במיוחד לבדיקה, תיקון וכתיבה של קוד מורכב.

  • אוטומציה עם הפעלת כלים

    המערכת כוללת מפענח מובנה לקריאות כלים ומצב חשיבה שמיועד לביצוע רצף פעולות אמין מול ממשקים חיצוניים.

  • פתרון בעיות היגיון ומתמטיקה

    ציון של 91.0% במבחן AIME 24 מוכיח יכולת ניתוח גבוהה במיוחד בשאלות חישוביות שמצריכות שלבי ביניים.

איפה זה נופל

המודל אומן ותומך רשמית באנגלית ובסינית בלבד. אין שום תיעוד או הבטחה ליכולות שלו בעברית, ולכן ניסוח פניות מורכבות בשפה המקומית עלול להוביל לטעויות תרגום והזיות. בנוסף, חלון ההקשר המלא של 128K טוקנים אינו שמיש בקונפיגורציית החומרה הבסיסית אלא דורש כמות כפולה של מעבדים גרפיים, מה שמגביל משימות ארוכות מאוד למי שמחזיק משאבים מוגבלים.

אותה משפחה

GLM-4.5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם כרטיס GPU בודד?

לא. מדובר במודל שדורש לפחות ארבעה כרטיסי H200 או שמונה כרטיסי H100 רק בשביל פעולת הסקה בסיסית, לצד טרהבייט של זיכרון מערכת. כרטיס בודד לא מסוגל אפילו לטעון את המשקלים לזיכרון.

איך מכבים את שלב החשיבה כדי לקבל תשובות מהירות?

בעת שליחת הבקשה לשרת דרך SGLang או vLLM, יש להעביר את הפרמטר enable_thinking שמוגדר כ־False בתוך chat_template_kwargs. ברירת המחדל מפעילה תמיד את מצב החשיבה.

איך מריצים

המשקל של הקבצים מגיע ל־337 גיגהבייט, ודרישות החומרה כאן קיצוניות. כדי להריץ את גרסת ה־FP8 הזו באמצעות SGLang נדרשים לפחות שמונה כרטיסי H100 או ארבעה כרטיסי H200, יחד עם שרת שמכיל מעל טרהבייט אחד של זיכרון RAM רק כדי לטעון את המשקלים. אם תרצו לנצל את כל חלון ההקשר של 128K טוקנים, תצטרכו להכפיל את המערך ל־16 כרטיסי H100.

ההרצה המקומית הגיונית רק לארגונים שמחזיקים תשתית כבדה ומחויבים לפרטיות מידע מוחלטת. לכל שימוש אחר, התקנה ותחזוקה של חומרה כזו עולות הון, ועדיף להתחבר ישירות ל־API הרשמי שמספקות החברות.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.5-FP8")
print(pipe("שלום"))

הקבצים

101 קבצים במאגר, 337 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון MIT. מדובר ברישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של המשקלים, פיתוח מוצרים נגזרים והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗