GPT
G

GLM-4.7-Flash

קוד פתוח

zai-orgmit2026-01-19

  • transformers
  • safetensors
  • glm4_moe_lite
  • text-generation
  • conversational

מודל תערובת מומחים של 31 מיליארד פרמטרים שמפעיל בפועל רק 3 מיליארד בכל שלב. הוא מכוון לביצועים חזקים במשימות קוד ותפעול סוכנים, ורץ על חומרה קלה בהרבה ממודלים מלאים.

  • 31Bפרמטרים
  • 202,752טוקנים בהקשר
  • 58.2 GBמשקל הקבצים
  • 1,896,071הורדות בחודש

מה זה

מדובר במודל שמשלב חלון הקשר עצום של 202,752 טוקנים עם ארכיטקטורת MoE קלה, שמפעילה רק 3 מיליארד פרמטרים מתוך 31 מיליארד בסך הכל. התוצאה היא מהירות תגובה גבוהה במיוחד שמתאימה למי שצריך תפוקה מהירה בלי לשלם במחיר החומרה של מודל ענק.

במדדים שפורסמו הוא מציג מספרים יוצאי דופן למשקל שלו. בבדיקת SWE-bench Verified לתיקון תקלות בקוד הוא רושם 59.2 אחוז, לעומת 22 אחוז של Qwen3-30B-A3B. גם במשימות סוכנים ודפדפן כמו τ²-Bench ו־BrowseComp הוא משאיר פער גדול מול המתחרים בקטגוריה, בעיקר בזכות מצב חשיבה שמיועד לשמור על רציפות לאורך כמה צעדים.

מתאים ל

  • סוכני פיתוח תוכנה אוטונומיים

    התוצאה של 59.2 אחוז ב־SWE-bench הופכת אותו לאופציה מקומית נדירה לבדיקה ותיקון תקלות בקוד.

  • ניתוח מסמכים טכניים באנגלית

    חלון של מעל 200 אלף טוקנים בשילוב עלות ריצה נמוכה מאפשרים עיבוד של קבצי תיעוד ענקיים.

  • אוטומציית פעולות דפדפן וכלי CLI

    המודל כולל מנתחי פקודות מובנים להפעלת כלים וביצועים גבוהים במבחני דפדפן ביחס לגודלו.

איפה זה נופל

המודל מאומן רשמית רק על אנגלית וסינית. עברית לא מופיעה ברשימת השפות הנתמכות, ולכן הסתמכות עליו לטקסטים בעברית תביא לפליטות משובשות והזיות.

בנוסף, חלק מהתוצאות הגבוהות במבחנים הושגו רק באמצעות התאמות פרומפט נקודתיות ותרגומים ידניים של פקודות סיום, מה שאומר שהיציבות שלו בסביבות סוכנים דורשת הגדרות מדויקות ולא עובדת חלק מהקופסה.

שאלות
נפוצות

האם המודל יפעל טוב בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. כל שימוש בעברית יישען על טוקניזציה לא מותאמת ויגרור ביצועים נמוכים ופליטת שגיאות, כך שהוא לא מומלץ למשימות בעברית.

כמה זיכרון GPU דרוש כדי להרים אותו?

קבצי המודל שוקלים 58.2 גיגה בייט. כדי להריץ אותו בצורה יציבה עם קונטקסט ארוך יש צורך במערך של ארבעה כרטיסי מסך, כפי שמוגדר בפקודות ההרצה הרשמיות של ספריות השרת.

איך מריצים

המשקל הכולל של הקבצים עומד על 58.2 גיגה בייט, והדוגמאות הרשמיות של vLLM ו־SGLang מוגדרות מראש לעבודה עם פיצול על פני 4 כרטיסי מסך. מי שרוצה להריץ אותו עצמאית יצטרך לפחות שני כרטיסי 48 גיגה בייט או ארבעה כרטיסי 24 גיגה בייט כדי להחזיק את המודל ולנצל את חלון ההקשר הארוך.

התמיכה בתוכנה עדיין מבוססת על גרסאות פיתוח מקדימות של vLLM ו־SGLang, ודורשת התקנה ישירה מהמאגרים. אם אין לכם שרת ייעודי פנוי ומתוחזק, זמין גם API רשמי בפלטפורמה של Z.ai שחוסך את כל כאב הראש של הניהול המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.7-Flash")
print(pipe("שלום"))

הקבצים

58 קבצים במאגר, 58.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון MIT. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם ורק עם שמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗