GPT
G

GLM-5.3-Flash-BF16

קוד פתוח

zai-orgmit2026-08-25

  • transformers
  • safetensors
  • glm5_next
  • image-text-to-text
  • conversational

מודל מולטימודלי ענק עם חלון של מיליון טוקנים, שמשלב ראייה וטקסט. הוא מתאים למי שרוצה ביצועי קוד וסוכנים ברמה גבוהה ומסוגל להתמודד עם משקל של 599 GB.

  • 321Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 599 GBמשקל הקבצים
  • 14,027הורדות בחודש

מה זה

מדובר במודל הראשון בסדרת GLM-5 שמטפל מראש גם בתמונה וגם בטקסט. יש לו 321 מיליארד פרמטרים בסך הכול, אבל רק 18 מיליארד מתוכם פעילים בכל רגע נתון, מה שמוריד את עלויות החישוב ביחס למודלים צפופים בגודל הזה. הוא אומן על קורפוס של 30 טריליון טוקנים ומשלב ארכיטקטורה של תשומת לב דלילה ולינארית יחד עם חיבורי mHC כדי לשמור על דיוק בהקשרים ארוכים.

לפי המפתחים, השילוב הזה עוקף את GLM-5.2 בעשירית מהמחיר ומתקרב למודלים מובילים בתחום התכנות ומשימות סוכנים. הוא מקבל תמונות ברזולוציה שבה הצד הקצר הוא לפחות 1.5K פיקסלים ומסוגל להחזיק הקשר עצום של 1,048,576 טוקנים, כך שניתן לנתח פרויקטים שלמים או מסמכים עמוסי גרפיקה בלי לחתוך אותם.

מתאים ל

  • ניתוח מאגרי קוד

    חלון של מיליון טוקנים מאפשר לקרוא ספריות שלמות, לחפש באגים ולכתוב סקריפטים מורכבים באנגלית.

  • סוכני אוטומציה מבוססי כלים

    הארכיטקטורה מותאמת למשימות שדורשות תכנון של שלבים מרובים ושימוש בכלים חיצוניים.

  • עיבוד מסמכים עם גרפיקה

    שילוב ראייה מובנה שמאפשר ניתוח תרשימים וטקסט יחד בהקשרים ארוכים במיוחד.

איפה זה נופל

הבעיה המרכזית עבור קהל מקומי היא השפות. המודל אומן רשמית רק על אנגלית וסינית, כך שאי אפשר לסמוך עליו בעברית בלי בדיקה יסודית של יכולות השפה והפענוח. מעבר לכך, ברירת המחדל מפעילה תקציב חשיבה מקסימלי שמאט את התשובות ומייקר את הריצה אם לא דורסים אותו ידנית לערך נמוך יותר.

אותה משפחה

GLM-5.3-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. הוא עשוי לייצר עברית מסוימת בגלל נתונים ברשת, אך הביצועים לא מובטחים ולא מומלץ להסתמך עליו במוצר שמיועד לעברית.

איך שולטים על זמן החשיבה של המודל?

מעבירים את הפרמטר reasoning_effort עם הערך low או high. ברירת המחדל היא max, מה שמנצל את מלוא יכולת החשיבה אך עשוי להאריך את זמני המענה.

איך מריצים

המשקל הכולל של הקבצים בפורמט BF16 מגיע ל־599 GB שמחולקים ל־130 קבצים. כדי להריץ דבר כזה לבד דרוש אשכול שרתים רציני עם כמה מעבדים גרפיים חזקים ומאות גיגה בייטים של זיכרון וידאו. המודל נתמך בספריות כמו vLLM, SGLang, Unsloth, KTransformers ו־TokenSpeed.

לרוב הצוותים אין את הברזלים האלה במשרד, ולכן הגיוני בהרבה להשתמש ב־API של Z.ai שזמין עבורו. אם אתם חייבים הרצה מקומית בגלל פרטיות או דרישות אבטחה, כדאי לשים לב להגדרות: ברירת המחדל של reasoning_effort היא max, ובשיחות רגילות מומלץ להעביר clear_thinking=true בתבנית הצ'אט.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-5.3-Flash-BF16")
print(pipe("שלום"))

הקבצים

130 קבצים במאגר, 599 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון MIT. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים פרטיים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗