GPT
G

GLM-5.2-NVFP4

קוד פתוח

nvidiamit2026-06-22

  • Model Optimizer
  • safetensors
  • glm_moe_dsa
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת בארבעה ביט של מודל ענק עם מליון טוקנים הקשר, שמיועדת למשימות תכנות וחשיבה מורכבות. היא מאפשרת להריץ מודל של 753 מיליארד פרמטרים עם ביצועים קרובים מאוד למקור.

  • 381Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 433 GBמשקל הקבצים
  • 939,693הורדות בחודש

מה זה

מדובר בגרסת NVFP4 של GLM-5.2 מבית ZAI, שעברה כימוס באמצעות Model Optimizer של אנבידיה. הארכיטקטורה מבוססת תערובת מומחים בהיקף של 753 מיליארד פרמטרים סך הכל, כשבכל ריצה מופעלים 40 מיליארד בלבד. הכימוס עצמו בוצע על המשקולות והאקטיבציות של השכבות הלינאריות במומחים, בעוד המומחה המשותף נשאר ללא שינוי, במטרה לשמר דיוק מרבי.

הבנצ׳מרקים מראים שהירידה בדיוק כמעט אפסית לעומת גרסת ה־FP8. במבחן GPQA Diamond לחשיבה ברמת תואר מתקדם התוצאה ירדה מ־89.52 ל־89.39, וב־SciCode נרשמו 49.04 נקודות מול 49.85 בבסיס. במבחני IFBench, אחזור בהקשר ארוך והפעלת כלים המודל המכווץ אפילו עקף מעט את המקור, כך שאין כאן פשרה מורגשת ביכולות כדי לחסוך זיכרון.

מתאים ל

  • סוכני אוטונומיה ותפעול כלים

    מציג מעל 98 אחוזי הצלחה במבחן טלקום מורכב של שימוש בכלים וקריאות API מרובות.

  • ניתוח מסמכים ארוכים במיוחד

    תומך בחלון הקשר של מליון טוקנים ומשיג מעל שבעים אחוז באחזור מידע AA-LCR.

  • פתרון בעיות מדעיות מורכבות

    מגיע לכמעט 90 אחוז במבחן GPQA Diamond לשאלות ברמת תארים מתקדמים.

איפה זה נופל

הכרטיס מדגיש שהמודל אומן על נתונים מהרשת הפתוחה, ולכן הוא עלול לפלוט שפה פוגענית, הטיות חברתיות, עובדות שגויות או מידע מיותר ולא מדויק גם כשהקלט נקי לחלוטין. במבחן הקוד המדעי SciCode הוא משיג פחות מחמישים אחוז, כך שלא מדובר במפתח אוטומטי חף מטעויות. בנוסף, נתוני האימון המקוריים אינם חשופים, והתאימות מוגבלת לחומרה החדשה ביותר של אנבידיה.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שמונה כרטיסי A100 או H100?

לא. ארכיטקטורת NVFP4 מותאמת באופן בלעדי לחומרת Blackwell כמו B200 ו־B300. במעבדים גרפיים ישנים יותר הפורמט הזה לא נתמך להרצה יעילה.

כמה זיכרון דרוש בפועל כדי לטעון את המשקולות?

הקבצים תופסים 433 גיגה בייטים על הדיסק, ומחולקים על פני 56 קבצים. כדי להריץ שרת עם הקשר ארוך של מליון טוקנים תצטרכו שמונה מאיצים עם זיכרון כולל של מאות גיגה בייטים.

איך מריצים

כדי להריץ מפלצת ששוקלת 433 גיגה בייטים צריך חומרת Blackwell ייעודית, כמו שרת עם שמונה מאיצי B200 או B300. הספריות הנתמכות הן SGLang או vLLM על גבי לינוקס, והפקודות הרשמיות דורשות הגדרה של tensor-parallel-size ל־8, יחד עם שימוש במפענחי כלים וחשיבה תואמים.

אם אין לכם קלאסטר מודרני בעלות עתק, אל תנסו לארח את זה עצמאית. לרוב המוחלט של הצוותים יהיה זול ופשוט בהרבה לגשת למודל דרך ספקי ענן או ממשקי API חיצוניים במקום להחזיק שרת כזה פעיל.

pip install -U huggingface_hub
hf download nvidia/GLM-5.2-NVFP4

הקבצים

56 קבצים במאגר, 433 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים או פרטיים, לשנות את הקוד והמשקולות, לשלב אותם במוצרים סגורים ולהפיץ אותם הלאה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗