GPT
G

GLM-5-FP8

קוד פתוח

zai-orgmit2026-02-11

  • transformers
  • safetensors
  • glm_moe_dsa
  • text-generation
  • conversational

מודל ענק בקוד פתוח שמכוון ישירות למשימות פיתוח מורכבות והרצת סוכנים אוטונומיים. הוא מציג חלון הקשר של מעל 200 אלף טוקנים ותוצאות קרובות מאוד למודלים המסחריים המובילים.

  • 754Bפרמטרים
  • 202,752טוקנים בהקשר
  • 704 GBמשקל הקבצים
  • 469,484הורדות בחודש

מה זה

מדובר במפלצת של 744 מיליארד פרמטרים בארכיטקטורת תערובת מומחים, שמפעילה רק 40 מיליארד פרמטרים בכל טוקן. כדי לא לחנוק את החומרה בחלונות הקשר גדולים, שילבו בו מנגנון קשב דליל בשם DSA. הדגש העיקרי כאן הוא לא שיחה נחמדה, אלא עבודה ממושכת על קוד, שימוש בכלים ופתרון בעיות הנדסיות במערכות מורכבות.

במבחני ביצועים הוא עומד ראש בראש מול ספינות הדגל הסגורות. במבחן הקוד SWE-bench Verified הוא מגיע ל־77.8 אחוז, ובמבחן השימוש בכלים HLE עם כלים הוא משיג 50.4 אחוז. זה אומר שבמשימות תכנות מעשיות, חיפוש ברשת ופתרון בעיות מתמטיות, הוא לא נופל כמעט בכלום ממודלים כמו קלוד או ג'מיני.

מתאים ל

  • סוכן תכנות לקוד מורכב

    התוצאות במבחן SWE-bench הופכות אותו למתאים במיוחד לבדיקת באגים, תיקון שגיאות והרצת פקודות בסביבת פיתוח.

  • ניתוח מסמכים טכניים

    חלון של 202,752 טוקנים מאפשר להזין ספריות קוד שלמות או תיעוד טכני כבד בבת אחת ולקבל תשובות מדויקות.

  • אוטומציה מבוססת דפדפן

    ציונים חזקים ב־BrowseComp מעידים על יכולת טובה לחפש, לסנן ולרכז מידע מכמה מקורות ברשת.

איפה זה נופל

המודל אומן רשמית רק על אנגלית וסינית, כך שאי אפשר לסמוך עליו בעברית בלי בדיקה יסודית וממוקדת. מעבר לזה, במבחני סייבר כמו CyberGym הוא עומד על 43.2 אחוז בלבד, ובמבחן Tool-Decathlon הוא משיג רק 38 אחוז. זה מראה שברגע שנותנים לו שרשרת ארוכה מדי של כלים מסובכים או משימות אבטחה מורכבות, הוא עדיין נוטה לטעות או להיתקע.

אותה משפחה

GLM-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מציין רשמית שתי שפות בלבד, אנגלית וסינית. הוא כנראה יצליח לקרוא ולכתוב עברית בסיסית בזכות דאטה כללי ברשת, אבל לא כדאי לבנות עליו למשימות מורכבות בשפה בלי לבדוק קודם.

האם אני יכול להריץ אותו על המחשב במשרד?

חד משמעית לא. משקל הקבצים הוא 704 גיגה בייט, והוא דורש מערך של שמונה כרטיסי מסך מקצועיים כדי לעלות לזיכרון. למחשב מקומי עדיף לחכות לגרסאות מכווצות יותר או לעבוד מול ה־API.

למה לבחור בו במקום במודל סגור של חברה גדולה?

היתרון המרכזי הוא שליטה מלאה ופרטיות תחת רישיון MIT פתוח לגמרי. אם יש לכם חומרה מתאימה ואתם לא רוצים שהדאטה ייצא מהארגון, מדובר באחד המודלים הפתוחים החזקים ביותר שקיימים כרגע.

איך מריצים

בשביל להריץ את גרסת ה־FP8 הזו לבד, תצטרכו שרת עם שמונה כרטיסי מסך חזקים מאוד, בדרך כלל שרת של שמונה מאיצים עם זיכרון כולל של מאות גיגה בייט. הקבצים לבדם שוקלים 704 גיגה בייט, כך שציוד ביתי או שרת ענן צנוע לא באים בחשבון. ההרצה עצמה נתמכת דרך פריימוורקים מודרניים כמו vLLM או SGLang, עם תמיכה מובנית בחלוקה על פני שמונה כרטיסים.

לרוב המפתחים והצוותים הקטנים אין היגיון כלכלי להחזיק תשתית כזו רק בשביל כמה קריאות ביום. במקרה כזה, עדיף בהרבה לפנות ל־API שמציעה החברה, במקום לשלם אלפי דולרים בחודש על שרת ייעודי שיישב חצי מהזמן בלי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-5-FP8")
print(pipe("שלום"))

הקבצים

150 קבצים במאגר, 704 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, וזה הרישיון הכי פתוח ונוח שיש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר שלכם, או למכור גישה אליו בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗