GPT
G

GLM-4.5V

קוד פתוח

zai-orgmit2025-08-10

  • transformers
  • safetensors
  • glm4v_moe
  • image-text-to-text
  • conversational

מודל מולטימודלי כבד שמשלב הסקת מסקנות עם תמונות ווידאו, ומפעיל רק חלק קטן מ־108 מיליארד הפרמטרים שלו בכל שלב. הוא מתאים למי שחייב ביצועים חזקים בסוכני מסך וזיהוי עצמים בתמונות.

  • 108Bפרמטרים
  • 65,536טוקנים בהקשר
  • 201 GBמשקל הקבצים
  • 46,639הורדות בחודש

מה זה

הארכיטקטורה כאן מבוססת על מודל תערובת מומחים עם 108 מיליארד פרמטרים בסך הכול, אבל רק 12 מיליארד מהם פעילים בכל טוקן נתון. זה אומר שמקבלים עומק של מודל ענק בלי לשלם בזמן חישוב של מודל צפוף מלא, לצד חלון הקשר של 65,536 טוקנים שמאפשר לנתח סרטונים ארוכים ומסמכים מרובי עמודים.

המודל כולל מתג חשיבה מובנה שמאפשר להפעיל שרשרת הסקה עמוקה לפני מתן תשובה או לכבות אותה לטובת זמני תגובה קצרים. הייחוד העיקרי שלו הוא היכולת לחבר בין תפיסה חזותית לפעולות בממשק משתמש, כולל החזרת קואורדינטות מדויקות של אלמנטים על גבי תמונות ומסכי מחשב בפורמט מנורמל.

מתאים ל

  • סוכני GUI ואוטומציה

    זיהוי אלמנטים וכפתורים במסכי מחשב או דפדפן והחזרת קואורדינטות מדויקות להקלקה.

  • ניתוח מסמכים ודוחות

    קריאת גרפים, טבלאות וקבצי PDF ארוכים עם חלון הקשר של 64 אלף טוקנים.

  • איתור עצמים בתמונות

    הפקת תיבות תוחמות מנורמלות לפי תיאור טקסטואלי חופשי ומורכב.

איפה זה נופל

המודל מגיע רשמית רק באנגלית ובסינית, כך שכל שימוש בעברית ידרוש בדיקה יסודית כדי לראות אם הוא מבין פקודות או טועה לחלוטין. היוצרים מודים בגלוי שהוא מתקשה במשימות תפיסה בסיסיות כמו ספירת פריטים וזיהוי פרצופים ספציפיים, ולעיתים נוטה לחשיבת יתר, חזרות מיותרות או חזרה על התשובה בסוף הפלט. בנוסף, יכולות הטקסט הנקי שלו נמוכות יותר כי האימון התמקד במולטימודל, ובמשימות יצירת קוד ממשק הוא פולט לפעמים קוד HTML גולמי עם שגיאות תווי מילוט שמחייבות שימוש בסקריפט תיקון חיצוני.

אותה משפחה

GLM-4.5V יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים ותמונות בעברית?

הכרטיס מציין רשמית תמיכה באנגלית ובסינית בלבד. סביר להניח שהוא יזהה תמונות היטב, אבל פענוח טקסט עברי בתוך תמונות או ניהול שיחה בעברית עלולים להניב שגיאות קשות וחוסר הבנה.

איך מבטלים את מצב החשיבה כדי לקבל תשובות מהירות?

בשרתי vLLM או SGLang מצב החשיבה מופעל כברירת מחדל. כדי לכבות אותו ולהאיץ את זמן התגובה, מעבירים פרמטר ייעודי של enable_thinking שמוגדר כ־False בתוך גוף הבקשה.

איך מריצים

כדי להריץ מודל במשקל 201 גיגה־בייט תצטרכו שרת ייעודי עם לפחות ארבעה כרטיסי GPU חזקים, בדיוק כפי שמוגדר בפקודות ההרצה הרשמיות עם חלוקה של 4 ב־Tensor Parallel. ההרצה המקומית נתמכת דרך ספריות כמו vLLM ו־SGLang, כאשר בסרטונים ארוכים חובה להשתמש ב־FlashAttention 3 כדי למנוע קריסות של זיכרון.

אם אין לכם תשתית ענן מרובת מאיצים מוכנה לפעולה, עדיף להשתמש ב־API של ZhipuAI במקום להחזיק שרת יקר שיעמוד ריק. תחזוקה עצמית שווה את זה רק אם אתם חייבים להריץ מקומית בגלל פרטיות או כשאתם מתכננים אימון התאמה אישית מלא דרך ספריות כמו LLaMA-Factory.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-4.5V")
print(pipe("שלום"))

הקבצים

56 קבצים במאגר, 201 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗