GPT
G

GLM-5.1-FP8

קוד פתוח

zai-orgmit2026-04-03

  • transformers
  • safetensors
  • glm_moe_dsa
  • text-generation
  • conversational

מודל ענק שמכוון למשימות פיתוח תוכנה מורכבות והרצת כלים ברצף ארוך. הוא מציג חלון הקשר של 202,752 טוקנים ומצטיין בריצות סוכנים שלא קורסות אחרי כמה צעדים בודדים.

  • 754Bפרמטרים
  • 202,752טוקנים בהקשר
  • 704 GBמשקל הקבצים
  • 316,998הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים עם ארכיטקטורת GlmMoeDsa ומעל 753 מיליארד פרמטרים. לפי היוצרים, המוקד כאן הוא היכולת לבצע עבודה סוכנותית ממושכת, כמו פתרון בעיות עמוקות בקוד, הפעלת כלי טרמינל ותיקון שגיאות איטרטיבי לאורך מאות מחזורים ואלפי קריאות לכלים בלי להיתקע.

במבחני ביצועים הוא עומד בחזית תחום הפיתוח, עם תוצאה של 58.4 ב־SWE-Bench Pro, שם הוא עוקף מודלים כמו GPT-5.4 ו־Claude Opus 4.6. הוא מציג קפיצה חדה במיוחד במשימות סייבר עם 68.7 ב־CyberGym לעומת 48.3 בגרסה הקודמת, ומוביל גם ב־BrowseComp. יחד עם זאת, במשימות היגיון ומתמטיקה טהורות ללא כלים כמו HLE או GPQA-Diamond, הוא עדיין מפגר אחרי מודלים מובילים של גוגל ומיקרוסופט.

מתאים ל

  • סוכן תכנות אוטונומי

    מתאים לפתרון באגים וכתיבת קוד מלאה בזכות תוצאה מובילה של 58.4 ב־SWE-Bench Pro.

  • אוטומציה בטרמינל

    מטפל ברצף ארוך של פקודות מערכת ואיטרציות תיקון לפי מדד Terminal-Bench 2.0.

  • מחקר סייבר ואבטחה

    מיועד לניתוח סביבות מורכבות עם ציון של 68.7 ב־CyberGym, הגבוה משמעותית מהמתחרים.

איפה זה נופל

המודל אומן רשמית רק באנגלית ובסינית, כך שאינו מיועד או מותאם לעבודה בעברית. בנוסף, במבחני היגיון רב־תחומיים ברמה גבוהה ללא כלים חיצוניים הוא קיבל ציון נמוך של 31.0 ב־HLE ושל 40.7 ב־Tool-Decathlon, מה שמראה שהוא תלוי מאוד בסביבת ריצה אינטראקטיבית כדי להגיע לתוצאות טובות.

אותה משפחה

GLM-5.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על תחנת עבודה רגילה עם כרטיס בודד?

לא. קובצי המודל שוקלים 704 גיגה בייט בפורמט FP8, ודרוש מערך שרתים עם זיכרון גרפי מצטבר גדול מאוד כדי לטעון ולהריץ אותם. מחשב פיתוח רגיל לא יצליח אפילו להעלות את המשקלים לזיכרון.

האם כדאי לבנות איתו מוצר שפונה לקהל ישראלי בעברית?

המודל מוגדר רשמית עבור אנגלית וסינית בלבד, והאימון שלו לא התמקד בעברית. אם הממשק או המשימה דורשים עברית טבעית, עדיף לבחור במודל עם תמיכה רב־לשונית רחבה יותר או לבדוק אותו ביסודיות קודם.

איך מריצים

להריץ 704 גיגה בייט של משקלים בפורמט FP8 זו משימה לתשתית שרתים רצינית בלבד. צריך אשכול שרתים ייעודי עם מספר מאיצים גרפיים חזקים כדי להחזיק את המודל ואת זיכרון הריצה לחלון ההקשר העצום, תוך שימוש במנועים כמו vLLM, SGLang, KTransformers או xLLM.

עבור רוב המפתחים והצוותים הקטנים, פריסה מקומית כזו פשוט לא כלכלית ומסורבלת לתחזוקה. במקרה כזה, עדיף להשתמש ב־API המנוהל של z.ai, ולשמור את ההרצה העצמית רק למי שחייב את המשקלים בתוך רשת סגורה ומחזיק חומרה מתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-5.1-FP8")
print(pipe("שלום"))

הקבצים

151 קבצים במאגר, 704 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי, הפצה והטמעה בכל מוצר סגור או פתוח, בלי צורך לחשוף את הקוד שלכם, כשהדרישה היחידה היא שמירת הקרדיט והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗