GPT
G

GLM-5.2-W4AFP8

קוד פתוח

PhalaCloudmit2026-06-18

  • sglang
  • safetensors
  • deepseek_v3
  • glm
  • glm_moe_dsa

גרסת קוונטיזציה של 4 ביט שמכווצת מודל ענק לשרת יחיד. היא מאפשרת להריץ חלון מלא של מיליון טוקנים בלי לחתוך בביצועים לעומת גרסת המקור.

  • 392Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 372 GBמשקל הקבצים
  • 45,035הורדות בחודש

מה זה

מדובר במודל MoE עם 78 שכבות שמבוסס על GLM-5.2 המקורי. המספר 392 מיליארד פרמטרים שמופיע במטאדטה נובע מאופן ספירת הסלוטים בזיכרון, אבל בפועל נשמרו כל 753 מיליארד הפרמטרים של המקור. הכיווץ כאן ממוקד במומחים המנותבים בלבד, שירדו ל־4 ביט בשיטת AWQ, בזמן ששאר חלקי הרשת כמו תשומת הלב והמומחים המשותפים נשארו ברמת דיוק גבוהה יותר.

התוצאה היא חיתוך נפח המשקלים מ־755 גיגהבייט ל־368 גיגהבייט. המדידות מראות שאין פגיעה מורגשת ביכולות. במבחן החשיבה GPQA-Diamond המודל מקבל 90.9 נקודות לעומת 91.2 במקור, במבחן IFBench למעקב אחרי הוראות הוא מגיע ל־75.0 נקודות, ובמבחן שליפת מחט מערימת שחת הוא מוצא את המידע בכל שלושת העומקים שנבדקו סביב 983 אלף טוקנים.

מתאים ל

  • ניתוח קבצי קוד ענקיים

    מאפשר לטעון מאגר קוד שלם של מיליון טוקנים בשרת בודד של שמונה כרטיסי H200 בלי לאבד דיוק בלוגיקה.

  • תחקור מסמכים ומחקר ארוך

    מציג שליפה מדויקת מקצה חלון ההקשר במבחן המחט, בלי צורך לחלק את הטקסט למקטעים מראש.

  • מערכות סוכנים וכלים

    שומר על ביצועי הפעלת פונקציות ברמה של 84 אחוזים מול מודל המקור, עם תמיכה מובנית בפיענוח קריאות.

איפה זה נופל

הבעיה המרכזית היא התלות המוחלטת במנוע SGLang ובארכיטקטורת SM90 של אנבידיה. הפריסה לא נבדקה ולא נתמכת ב־vLLM או במנועים נפוצים אחרים, כך שאי אפשר לשלב אותו בקלות בתשתיות קיימות שמבוססות עליהם. בנוסף, חובה להקפיד על הגדרת top_p של 0.95 בזמן הפריסה, כי ריצה ללא חיתוך כזה במצב חשיבה גורמת למודל להיכנס ללולאות של חזרתיות. המודל גם מוגבל רשמית לשפות אנגלית וסינית בלבד, כך שאין לצפות לביצועים סבירים בעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על vLLM?

לא. מבנה ה־4 ביט והפענוח הספקולטיבי נבנו במיוחד עבור מנוע SGLang, והמפתחים מצהירים שהמודל לא נבדק על vLLM או על מנועי הסקה אחרים.

האם אפשר להסתפק בשמונה כרטיסי H100 רגילים?

אפשר להעלות את המודל, אבל לא תגיעו לחלון המלא. המשקלים ייכנסו לזיכרון, אך ה־KV cache יוגבל לכ־400 אלף טוקנים בלבד במקום מיליון.

למה המטאדטה מציגה 392 מיליארד פרמטרים במקום 753?

מדובר במוזרות של ספירת סלוטים באחסון. כל סלוט של 8 ביט מכיל שני משקלים של 4 ביט, כך שהמערכת סופרת את מקומות האחסון ולא את כמות הפרמטרים בפועל.

איך מריצים

בשביל להריץ אותו צריך שרת עם שמונה כרטיסי Hopper, כלומר H100 או H200. בשרת של שמונה כרטיסי H200 יש מספיק זיכרון גם למשקלים וגם ל־KV cache של מיליון טוקנים שלמים. בשרת שמונה כרטיסי H100 המשקלים נכנסים, אבל נשאר מקום רק לכ־400 אלף טוקנים בהקשר.

ההרצה מוגבלת כרגע לספריית SGLang בגרסה v0.5.13.post1 ומעלה, עם תמיכה בשכבת חיזוי טוקנים מרובים שמאפשרת קצב של 118 טוקנים לשנייה בזרם יחיד. אם אין לכם גישה לשרת שמונה כרטיסי Hopper באחד העננים, אין טעם לנסות להוריד 372 גיגהבייט של קבצים, ועדיף להשתמש ישירות ב־API של z.ai.

pip install -U huggingface_hub
hf download PhalaCloud/GLM-5.2-W4AFP8

הקבצים

51 קבצים במאגר, 372 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בכל שרת ולהטמיע אותו במוצרים ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, לצד בקשת היוצרים לתת קרדיט למאמר של GLM-5.2.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗