GPT
G

GLM-4.1V-9B-Thinking

קוד פתוח

zai-orgmit2025-06-28

  • transformers
  • safetensors
  • glm4v
  • image-text-to-text
  • reasoning

זה מודל ראייה ושפה קומפקטי שמביא תהליכי חשיבה עמוקים לניתוח תמונות. הוא נבנה לפתרון בעיות ויזואליות מורכבות בלי לדרוש מפלצת חישוב בארגון.

  • 10Bפרמטרים
  • 65,536טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 177,472הורדות בחודש

מה זה

מדובר במודל ראייה שמשלב שרשרת חשיבה עם חיזוקים בלמידה על בסיס משקלי השפה של GLM-4-9B-0414. במקום לפלוט תיאור שטחי של תמונה, הוא מנתח אותה בשלבים מפורטים, תומך ברזולוציה של עד 4K ביחסי גובה-רוחב חופשיים, ומחזיק חלון הקשר של 65,536 טוקנים שמתאים גם להזנת מסמכים ארוכים וסרטוני וידאו.

במבחני הביצועים הוא עקף מודלים אחרים בקטגוריית עשרת מיליארד הפרמטרים בעשרים ושלושה מתוך עשרים ושמונה מבחנים, ובשמונה עשר מבחנים אף עבר את Qwen-2.5-VL-72B הגדול ממנו בהרבה. זה אומר שבמשימות מתמטיקה והיגיון ויזואלי מקבלים דיוק של מודל ענק במעטפת משקלים קטנה בהרבה.

מתאים ל

  • פתרון בעיות מתמטיקה

    ניתוח תרשימים ומשוואות ויזואליות בזכות שרשרת חשיבה מובנית שמשפרת דיוק.

  • פענוח מסמכים מורכבים

    קריאת תרשימים ברזולוציית 4K עם חלון הקשר רחב שמכיל את כל המידע.

  • ניתוח וידאו

    הבנת רצפי תמונות בזכות תמיכה בווידאו וחלון של 65,536 טוקנים.

איפה זה נופל

המודל אומן רשמית רק על אנגלית וסינית, כך שאי אפשר לסמוך עליו בטקסטים בעברית או בהבנת תמונות עם כיתוב מקומי. בנוסף, מנגנון החשיבה המעמיק מייצר המון טוקנים פנימיים לפני התשובה הסופית, מה שהופך את זמן התגובה לאיטי בהשוואה למודלי ראייה סטנדרטיים ומגביל את השימוש בו בממשקים בזמן אמת.

אותה משפחה

GLM-4.1V יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית מתוך תמונות?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. הוא לא הוכשר על עברית, ולכן ניתוח טקסט עברי במסמכים או תמונות צפוי להיכשל או להחזיר שגיאות.

איך מריצים אותו מקומית בפייתון?

מתקינים את transformers בגרסה 4.57.1 ומעלה ישירות מהמקור לפי ההנחיות. לאחר מכן טוענים את Glm4vForConditionalGeneration עם המשקלים שהורדו.

למה המענה שלו לוקח יותר זמן ממודל ראייה רגיל?

הוא מיישם שרשרת חשיבה מלאה לפני הפקת הפלט הסופי. תהליך החישוב הפנימי מעלה את הדיוק אבל דורש הפקת טוקנים נוספים שמאיטים את התשובה.

איך מריצים

המשקלים שוקלים 19.2 גיגהבייט ודורשים התקנה ישירה של ספריית transformers בגרסה 4.57.1 ומעלה דרך הקוד. כדי להחזיק את כל המשקלים בזיכרון הקיים לצד קלטי תמונה ברזולוציית 4K וחלון הקשר מלא, נדרש כרטיס גרפי עם זיכרון גדול מספיק למשקלים האלה בצירוף שכבת החישוב.

אם אתם לא רוצים להחזיק תשתית ייעודית שתתמודד עם צריכת הזיכרון הזו בזמן חשיבה ארוכה, יש גישה דרך ה־API הרשמי של Zhipu, מה שמתאים בעיקר למי שצריך קריאות בודדות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-4.1V-9B-Thinking")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהטמיע אותו במוצרים שלכם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗