GPT
G

GLM-4.7-FP8

קוד פתוח

zai-orgmit2025-12-22

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • conversational

זה מודל קוד וחשיבה עצום בתצורת Mixture of Experts שמכוון להתחרות ישירות במודלים המובילים בעולם. הוא מתאים למי שבונה סוכני תכנות אוטונומיים ורוצה שליטה מלאה בתהליך ההסקה.

  • 358Bפרמטרים
  • 202,752טוקנים בהקשר
  • 337 GBמשקל הקבצים
  • 20,189הורדות בחודש

מה זה

מדובר במודל שפת קוד שמתמחה בביצוע משימות פיתוח מורכבות דרך ממשקי שורת פקודה וסוכנים. הוא תומך בהפעלת כלים חיצוניים, יצירת ממשקי משתמש, ופתרון בעיות מתמטיות קשות. הייחוד העיקרי שלו הוא יכולת חשיבה רב שלבית שבה הוא מייצר בלוקי מחשבה לפני כל פעולה או קריאה לפונקציה, ויודע לשמר את המחשבות האלו לאורך שיחות מרובות תורות כדי למנוע אובדן הקשר.

במדדי ביצועים המודל מציג זינוק בהשוואה לגרסה הקודמת. במבחן SWE-bench Verified הוא מגיע ל־73.8% הצלחה, וב־SWE-bench Multilingual הוא עומד על 66.7%. במבחן האתגרים הקשים של Terminal Bench Hard הוא מקבל 33.3%, תוצאה שממקמת אותו קרוב למודלים הקנייניים של המתחרים, אם כי במשימות שורת פקודה מורכבות יש מודלים מסחריים שעוקפים אותו.

מתאים ל

  • סוכני פיתוח תוכנה

    אינטגרציה לכלים כמו Cline בזכות יכולת שימור בלוקי החשיבה בין פקודות.

  • אוטומציה בשורת הפקודה

    הרצת משימות מסוף וכלים חיצוניים בזכות מנגנוני ניתוח קריאות מובנים.

  • פתרון בעיות היגיון וקוד

    הפקת פתרונות מתמטיים מורכבים עם דיוק של 95.7% במבחן AIME 2025.

איפה זה נופל

המודל מאומן על אנגלית וסינית בלבד, כך שעבודה בעברית אינה חלק מהיכולות הנתמכות שלו ועשויה להפיק תוצאות ירודות או משובשות. בנוסף, בביצוע פעולות שורת פקודה קשות במבחן Terminal Bench Hard הוא פותר רק שליש מהמקרים, כך שסוכן עצמאי לחלוטין עלול להיתקע במשימות מערכת מורכבות. מצב שימור החשיבה על פני תורות דורש כרגע תמיכה ספציפית ב־SGLang ולא עובד בצורה מלאה בכל תשתית.

אותה משפחה

GLM-4.7 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח רגיל?

לא. משקל הקבצים עומד על 337 גיגהבייט ומדובר ב־358 מיליארד פרמטרים. כדי להריץ אותו נדרש שרת ייעודי עם ארבעה עד שמונה מעבדים גרפיים חזקים.

האם המודל מתאים לפרויקטים בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. כל שימוש בעברית ידרוש בדיקה יזומה ואינו מובטח מבחינת איכות התוצאה.

מה ההבדל בין vLLM ל־SGLang בהרצת המודל?

שתי הספריות מריצות את המודל בגרסאות הפיתוח שלהן, אך מצב שימור החשיבה הרציף לאורך תורות נתמך כרגע רק בהגדרות של SGLang.

איך מריצים

כדי להרים אותו מקומית תצטרכו שרת ייעודי כבד. קובצי המודל שוקלים 337 גיגהבייט ומחולקים ל־101 קבצים, כך שאין שום אפשרות לטעון אותם על חומרה צרכנית רגילה. הרצה מעשית מתבצעת דרך vLLM או SGLang עם חלוקת המשקלים על גבי ארבעה או שמונה מאיצים גרפיים במקביל. שני הכלים דורשים גרסאות פיתוח עדכניות כדי לתמוך בארכיטקטורה הזו.

אם אין לכם אשכול שרתים ייעודי עם מאות גיגהבייט של זיכרון גרפי מהיר, אל תנסו לארח אותו לבד. עלות החומרה והתחזוקה תהיה גבוהה מדי, ועדיף להתחבר ישירות דרך ה־API שמספקת החברה.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4.7-FP8")
print(pipe("שלום"))

הקבצים

101 קבצים במאגר, 337 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗