GPT
G

GLM-5.2-Vision-NVFP4

קוד פתוח

basetenmit2026-07-20

  • sglang
  • safetensors
  • glm5v
  • multimodal
  • vision-language

יש כאן גם סקירה על Baseten עצמו.

חיבור ישיר בין מודל חשיבה ענק לראייה ממוחשבת, עם חלון של מיליון טוקנים בכימות FP4. הוא נותן יכולות הסקה חזקות על תמונות ומסמכים ארוכים למי שמחזיק חומרת Blackwell.

  • 381Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 434 GBמשקל הקבצים
  • 13,716הורדות בחודש

מה זה

הבסיס כאן הוא המודל הטקסטואלי GLM-5.2, שמכיל 744 מיליארד פרמטרים בארכיטקטורת MoE עם כארבעים מיליארד פרמטרים פעילים, כשאליו חיברו את מודל הראייה MoonViT מבית Kimi-K2.6. שני המודלים המקוריים הוקפאו לחלוטין ללא שינוי משקולות. החיבור ביניהם מתבצע דרך מתאם PatchMerger ייעודי של 49.5 מיליון פרמטרים בלבד, שמתרגם את הפאצ'ים מהתמונה ישירות למרחב הטוקנים של מודל השפה.

המבנה הזה מיועד לעבד תמונות כחלק מתהליך החשיבה והסקת המסקנות הרגיל של המודל. הוא ממיר כל תמונה לעד 4,096 טוקנים באמצעות דחיסה של פאצ'ים, ומסוגל להחזיר את שרשרת המחשבה המלאה במקביל לתשובה הסופית, תוך ניצול תמיכה מובנית בקריאות לכלים חיצוניים.

מתאים ל

  • ניתוח מסמכים טכניים מורכבים

    שילוב של חלון הקשר ענק ויכולת הסקה שמאפשר לחבר שרטוטים, דיאגרמות ועמודי מלל ארוכים.

  • הפעלת סוכנים מבוססי ראייה

    תמיכה מובנית בקריאה לכלים יחד עם פלט מסודר של שרשרת חשיבה מתוך תמונות.

  • עיבוד ויזואלי מהיר ב־FP4

    הסקה מהירה וחסכונית בזיכרון על שרתי Blackwell תואמים ללא המרת דיוק נוספת.

איפה זה נופל

החיסרון הברור ביותר הוא דרישת החומרה הקשיחה, שחוסמת בפועל כמעט כל תשתית קיימת בשוק ומחייבת כרטיסי Blackwell חדשים. בנוסף, מנוע הראייה ומודל הטקסט לא אומנו יחד מקצה לקצה אלא חוברו באמצעות שכבת תיאום קטנה יחסית, כך שדיוק הראייה מוגבל למה שמתאם של 49.5 מיליון פרמטרים מצליח להעביר. הארכיטקטורה גם אינה חלק מהקוד הראשי של ספריות הליבה, ודורשת פאץ' חיצוני של SGLang שעלול להישבר בעדכונים עתידיים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת של 8 כרטיסי H100?

לא. המשקולות מכוילות בפורמט NVFP4 שנתמך טכנית רק בארכיטקטורת Blackwell של אנבידיה. הרצה מקומית מחייבת שרת עם מאיצי B200.

כמה זיכרון תופסת תמונה בתוך חלון ההקשר?

כל תמונה עוברת דחיסה ומקודדת לעד 4,096 טוקנים במודל השפה. מתוך חלון של מעל מיליון טוקנים, זה משאיר מרחב עצום להיסטוריית שיחה ומסמכים מרובי עמודים.

איך מריצים

אי אפשר להריץ את המשקולות האלה על שרתי H100 או כרטיסים ביתיים. הכימות הוא NVFP4, מה שמחייב חומרת Blackwell של Nvidia בלבד. כדי לקבל את מלוא חלון ההקשר של מיליון טוקנים חייבים שרת עם 8 מאיצי B200, ואם מסתפקים בחלון של 256 אלף טוקנים אפשר לרדת למערך של 4 מאיצים.

ההרצה מתבצעת דרך SGLang ודורשת התקנה של תוסף חיצוני שנמצא בתוך המאגר, בגלל שהארכיטקטורה עוד לא נתמכת רשמית בספריות הראשיות. ההורדה שוקלת כ־434 ג'יגה-בייט וזמן העלייה הראשוני לוקח כמה דקות. אם אין לכם גישה ישירה לשרתי B200, האפשרות המעשית היחידה היא פריסה מנוהלת בענן דרך Truss ו־Baseten.

pip install -U huggingface_hub
hf download baseten/GLM-5.2-Vision-NVFP4

הקבצים

70 קבצים במאגר, 434 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם ברישיון MIT, כולל משקולות המתאם שאומנו לצורך החיבור. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו. עם זאת, המשקולות כוללות רכיבים שהגיעו במקור מ־GLM-5.2 ו־Kimi-K2.6, ולכן שימוש מסחרי במוצר דורש לוודא עמידה בתנאי השימוש המקוריים של שני המודלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗