GPT
G

GLM-5.3-Flash

קוד פתוח

zai-orgmit2026-08-25

  • transformers
  • safetensors
  • glm5_next
  • image-text-to-text
  • conversational

הוא משלב קלט תמונה וטקסט עם חלון של מיליון טוקנים, ומפעיל רק 18 מיליארד פרמטרים בכל רגע כדי לחתוך בעלויות הריצה.

  • 321Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 306 GBמשקל הקבצים
  • 826,875הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמתמודד ישירות עם תמונות וטקסט, ומבוסס על שילוב של קשב דליל וליניארי יחד עם ארכיטקטורת mHC. המטרה של התכנון הזה היא לפתור את צוואר הבקבוק המוכר של עיבוד הקשר ארוך. במקום לחשב קשב מלא על פני מיליון טוקנים, המודל משתמש בנתיבים דלילים שמורידים את עלויות החישוב בלי לאבד דיוק לאורך ההקשר, לפי נתוני היוצרים.

הוא אומן על קורפוס של שלושים טריליון טוקנים, ולפי הכרטיס מציג ביצועים שמתקרבים לקלוד אופוס 4.8 במשימות תכנות וסוכנים אוטונומיים. הוא כולל מנגנון חשיבה מובנה שמאפשר לשלוט בתקציב המחשבה דרך פרמטר ייעודי, ומגיע לרמת חשיבה מקסימלית כברירת מחדל אלא אם מגדירים אחרת. בהשוואות מול גרסאות קודמות של הסדרה הוא מציג מהירות תגובה עדיפה בזכות העובדה שמתוך 321 מיליארד פרמטרים בסך הכל, רק חלק קטן פעיל בכל צעד חישובי.

מתאים ל

  • ניתוח מסמכים חזותיים

    חלון של מיליון טוקנים בשילוב קלט תמונה מתאים לסריקה של תיעוד טכני ענק, שרטוטים וספרים שלמים.

  • סוכני תכנות אוטונומיים

    מנגנון חשיבה עמוק ותוצאות גבוהות במבחני קוד מאפשרים לו להתמודד עם שינויים מורכבים במאגרי קוד גדולים.

  • אוטומציה של משימות מסוף

    הארכיטקטורה שלו נבדקה במבחני סביבות פיתוח ומסופים לביצוע שרשראות פקודה ארוכות ללא התערבות ידנית.

איפה זה נופל

המודל תומך רשמית רק באנגלית ובסינית, כך שקלט או פלט בעברית עלולים להניב תוצאות שבורות ולא אמינות. ברירת המחדל שלו היא להפעיל מחשבה מקסימלית, מה שעלול לייצר זמני השהיה ארוכים מאוד בשיחות רגילות אם לא מגדירים ידנית תקציב חשיבה נמוך. בנוסף, תבנית הצ'אט שלו שומרת את בלוקי החשיבה בהיסטוריה אלא אם מנקים אותם במפורש, מה שיכול לנפח את ההקשר מהר מאוד ולגרור התנהגות לא צפויה מול משתמשי קצה.

אותה משפחה

GLM-5.3-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יבין עברית?

הוא אומן ותועד רשמית רק עבור אנגלית וסינית. הוא עשוי לפלוט מילים בעברית, אבל בהיעדר תמיכה מוצהרת זה ייגמר בטעויות תחביר והזיות. למוצרים שמיועדים לקהל מקומי עדיף לא להסתמך עליו כרגע.

איך מונעים ממנו לחשוב יותר מדי זמן בכל שאלה?

המודל מגיע עם פרמטר שנקרא reasoning_effort שמוגדר כברירת מחדל על מקסימום. כדי לקבל תשובות מהירות ולא לחכות דקות ארוכות, צריך לשנות אותו ידנית לרמה נמוכה בקריאה למודל. בנוסף, בצ'אט כדאי להפעיל את הדגל clear_thinking כדי לא לסחוב את טקסט המחשבה הלאה.

איך מריצים

כדי להריץ אותו מקומית תצטרכו להתמודד עם קבצים במשקל 306 גיגה בייט. למרות שרק 18 מיליארד פרמטרים פעילים בכל רגע, כל 321 המיליארד חייבים לשבת בזיכרון, מה שמחייב שרת מרובה מאיצים עם מאות גיגות של VRAM. הוא נתמך בספריות כמו vLLM, SGLang, Unsloth וטרנספורמרס.

אם אין לכם אשכול שרתים ייעודי שפועל מסביב לשעון, החזקה עצמית של מפלצת כזו היא כאב ראש יקר. במרבית המקרים, פנייה ל־API של Z.ai תהיה צעד חכם יותר מאשר שכירת שרתים יקרים לעיבוד מזדמן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-5.3-Flash")
print(pipe("שלום"))

הקבצים

73 קבצים במאגר, 306 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT, שזה הרישיון הכי פתוח ומתיר שיש. מותר לקחת אותו, להריץ אותו, לשנות אותו ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. הדרישה היחידה היא לצרף את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗