GPT
G

GLM-5.3-Flash-NVFP4

קוד פתוח

LibertAIDAImit2026-08-26

  • safetensors
  • glm5_next
  • nvfp4
  • blackwell
  • sglang

גרסת קוונטיזציה של 4 ביט למודל MoE ענק שמשלב טקסט ותמונה עם חלון של מיליון טוקנים. הוא מכווץ משקל של 600 גיגה לתוך 181 גיגה כדי לרוץ על חומרה נגישה יותר.

  • 165Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 181 GBמשקל הקבצים
  • 40,396הורדות בחודש

מה זה

מדובר במודל שנוצר ממודל הבסיס GLM-5.3-Flash ומכיל 165 מיליארד פרמטרים, כאשר המומחים ברשת ה־MoE עברו המרה ל־NVFP4 וכל השאר נשאר ב־BF16 מלא. רכיב הראייה נשמר במקור שלו, כך שעיבוד התמונה זהה לחלוטין למודל המקורי ללא פשרות. הוא בנוי על ארכיטקטורה חדשה שמשלבת מנגנון קשב ליניארי לצד קשב דליל, מה שמאפשר לו לטפל בחלון הקשר עצום של עד מיליון טוקנים.

בדיקות הדמיון מול מודל המקור הראו תוצאת קוסינוס של 0.99665 ושגיאה יחסית של כ־0.0925. המספרים האלה מראים שהכיווץ לא פגע ביציבות המתמטית של המשקולות, אך יוצרי הדגם לא פרסמו נתוני מהירות בפועל ולא התחייבו על קצב יצירת טוקנים מעבר לכך שהוא נבדק ומייצר פלט קוהרנטי.

מתאים ל

  • ניתוח מסמכים ארוכים באנגלית

    חלון של מיליון טוקנים מאפשר לטעון תיעוד שלם וספרים טכניים ללא קיטוע.

  • עיבוד תמונות מדויק

    רכיב הראייה נשמר ב־BF16 מלא ללא קוונטיזציה ולכן התמונות מפוענחות ללא ירידה באיכות.

  • הפעלת כלים וקריאות פונקציה

    מבנה המודל תומך בהפעלת כלים מובנית דרך מפענח glm47 מתאים.

איפה זה נופל

המודל הזה קשה מאוד לתפעול בסביבות עבודה רגילות. מנוע ה־vLLM נוטה לאפס את הפלט לחלוטין ולחזור על מילה בודדת אם משתמשים בגרסה ישנה של קובץ הסקלות או במפענח MoE שלא הוגדר נכון. בנוסף, זיכרון המצב של שכבות הקשב הליניארי מציב תחרות ישירה מול כמות הבקשות המקבילות, ואי אפשר להריץ עליו הרבה משתמשים בו זמנית בלי שהמערכת תקרוס מחוסר זיכרון. תמיכה ישירה בעברית לא רשומה במפרט, והוא מיועד רשמית רק לאנגלית ולסינית.

שאלות
נפוצות

האם אפשר להריץ את המודל דרך llama.cpp או בפורמט GGUF?

לא. הארכיטקטורה החדשה אינה נתמכת ב־llama.cpp ולכן אין לו גרסאות GGUF. הדרך היחידה להריץ אותו מקומית היא במנועים ייעודיים כמו vLLM או SGLang שנבנו עבור הדגם הזה.

למה המודל מחזיר תשובה ריקה כשמפעילים כלי עבודה?

הסיבה היא שימוש במפענח ישן כמו glm במקום glm47. המפענח הישן בולע את הפלט אך לא מייצר את קריאת הכלי, ולכן הבקשה מסתיימת בלי תוכן ובלי שגיאה.

כמה משתמשים מקבילים אפשר לשרת על שרת מקומי?

מעט מאוד. שכבות הקשב הליניארי צורכות זיכרון ייעודי לכל בקשה פתוחה, כך שבהרצה על שני כרטיסי GB10 עם חלון הקשר סביר ניתן להגיע לעיתים רק לשתי בקשות בו זמנית.

איך מריצים

כדי להריץ 181 גיגה בייט של משקולות צריך מנועי הרצה תואמים כמו vLLM או SGLang, אך הארכיטקטורה החדשה עדיין לא נכנסה לגרסאות הרשמיות הראשיות ומחייבת שימוש באימג'ים ייעודיים. החומרה שנבדקה בפועל היא צמד כרטיסי GB10 של אנבידיה עם חלוקה של TP שווה ל־2, כאשר כרטיסי Blackwell ארגוניים כמו H100, B200 או GB200 נתמכים ישירות בארבעה כרטיסים.

אין תמיכה ב־llama.cpp ולכן קובצי GGUF לא קיימים כאן. אם אין לכם גישה למערך שרתים עם זיכרון וידאו מספק ומעבדים גרפיים מתאימים, עדיף להשתמש ב־API מרוחק במקום להתעסק בבניית קרנלים מקומיים והורדת 131 קבצים למחשב.

pip install -U huggingface_hub
hf download LibertAIDAI/GLM-5.3-Flash-NVFP4

הקבצים

131 קבצים במאגר, 181 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות היא חופש פעולה מלא, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או חיצונית כחלק ממוצר שלכם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים הנלווים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗