GPT
G

GLM-5.2-FP8

קוד פתוח

zai-orgmit2026-06-16

  • transformers
  • safetensors
  • glm_moe_dsa
  • text-generation
  • conversational

ענק קוד והסקה בקוד פתוח עם חלון של מיליון טוקנים בפורמט FP8. מתאים למי שחייב לנתח מאגרי קוד ענקיים מקומית תחת רישיון חופשי.

  • 753Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 704 GBמשקל הקבצים
  • 1,322,110הורדות בחודש

מה זה

מדובר במודל MoE עצום שמכיל 753 מיליארד פרמטרים ומגיע כמשקולות מכוילות ב־FP8. הוא תוכנן להתמודד עם משימות תכנות מורכבות וסוכנים לאורך זמן, כשהיתרון המרכזי שלו הוא שמירה על ביצועים יציבים גם בתוך חלון של 1,048,576 טוקנים. כדי להתמודד עם עומס החישוב בחלונות כאלה, הארכיטקטורה משתפת אינדקסים בין שכבות קשב דלילות ומשפרת את פענוח הניחוש (speculative decoding).

במבחני תכנות מעשיים כמו SWE-bench Pro הוא עומד על 62.1, ובמדד FrontierSWE שמיועד לחלונות ענק הוא מגיע ל־74.4. זה ממקם אותו קרוב מאוד למודלים סגורים מובילים כמו GPT-5.5 או Claude Opus 4.8 בחלק ממשימות התוכנה והמתמטיקה, ורחוק משמעותית מהגרסה הקודמת שלו בסדרה.

מתאים ל

  • סריקת מאגרי קוד עצומים

    הוא קורא מיליון טוקנים בבת אחת ויכול לנתח ארכיטקטורה של ריפוזיטורי שלם בלי לחתוך קבצים.

  • פתרון באגים במערכות סגורות

    הרישיון החופשי והיכולת להריץ מקומית מתאימים לצוותי פיתוח שלא מורשים להוציא קוד החוצה.

  • סוכני פיתוח אוטונומיים

    הוא תומך בכלי עבודה ובבקרת הרצה ארוכה ברמה תחרותית מאוד ביחס למודלים פתוחים.

איפה זה נופל

המודל אומן רשמית רק על אנגלית וסינית, כך ששימוש בעברית אינו נתמך ישירות וסביר שיניב תוצאות שבורות או איטיות. למרות החלון הארוך, במבחן משימות התוכנה הארוכות SWE-Marathon הוא משיג רק 13.0, וברמת הכלים (Tool-Decathlon) הוא עומד על 48.2 ונופל ממודלים מובילים אחרים. משימות הדורשות שרשרת פעולות ממושכת של שעות עדיין גורמות לו לאבד את הכיוון.

אותה משפחה

GLM-5.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על תחנת עבודה בודדת?

לא. משקל הקבצים לבדו הוא 704GB, וכדי לאפשר הסקה עם הקשר רחב נדרש קלאסטר של מעבדים גרפיים עם קרוב לטרה־בייט זיכרון וידאו. מחשב עם כרטיס אחד או שניים לא יצליח אפילו לטעון את המשקולות.

איך הוא מתפקד בשפה העברית?

כרטיס המודל מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא אומן ולא נבדק על עברית, ולכן לא מומלץ להסתמך עליו לפרויקטים שדורשים עיבוד שפה מקומית.

האם יש צורך לשלם על שימוש מסחרי בו?

לא, רישיון MIT מאפשר שימוש מסחרי מלא ללא תשלום תמלוגים. העלות היחידה שלכם תהיה החומרה הכבדה שדרושה כדי להריץ אותו או השימוש בחשבון ה־API.

איך מריצים

כדי להריץ אותו מקומית ב־FP8 תצטרכו קלאסטר של שרתים ייעודיים. קבצי המודל שוקלים 704GB ומחולקים ל־150 חלקים, כך שצריך לפחות 800GB עד 1TB של זיכרון וידאו (VRAM) מהיר רק כדי לטעון אותו, עוד לפני חישוב ה־KV cache עבור חלון של מיליון טוקנים. הוא נתמך בספריות כמו SGLang, vLLM, KTransformers ו־Unsloth, וכן על מעבדי Ascend.

אלא אם כן יש לכם חוות שרתים של 8 עד 16 כרטיסי H100 או מקביליהם, אין סיבה מעשית להריץ אותו לבד במשרד. לרוב מפתחי המוצר עדיף לגשת ישירות ל־API שהחברה מציעה, ולשמור את ההרצה העצמאית רק לארגונים עם דרישות אבטחה חריגות שמחייבות סביבה מבודדת לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-5.2-FP8")
print(pipe("שלום"))

הקבצים

150 קבצים במאגר, 704 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT. מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים סגורים, שינוי המשקולות, אירוח בתשלום והפצה מחדש, ללא תמלוגים או הגבלות אזוריות, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗