GPT
G

GLM-4.6V-Flash

קוד פתוח

zai-orgmit2025-12-07

  • transformers
  • safetensors
  • glm4v
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שמביא קריאת פונקציות ישירות מתוך תמונות ומסמכים ארוכים. הוא מיועד למי שרוצה סוכן ויזואלי מהיר בהרצה מקומית בלי לתחזק מפלצת ענקית.

  • 10Bפרמטרים
  • 131,072טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 79,979הורדות בחודש

מה זה

המודל הזה לוקח משימות ויזואליות ומחבר אותן ישר לקוד. בניגוד למודלים שמסתפקים בתיאור תמונה, הוא נבנה להפעיל כלים ופונקציות ישירות מתוך צילומי מסך, תרשימים ודפי מסמכים, בלי להמיר אותם לטקסט קודם. הוא גם יודע לייצר שילוב של טקסט ותמונות, ולבנות קוד של אתרים מתוך צילום ממשק בלבד.

היתרון הגדול מול חלופות באותו סדר גודל הוא השילוב בין נפח קטן יחסית לחלון הקשר עצום של 128 אלף טוקנים. זה אומר שאפשר לזרוק אליו ספרים סרוקים, חוזים ארוכים ומצגות עמוסות גרפים, והוא ינתח את המבנה והעיצוב שלהם יחד עם הטקסט.

מתאים ל

  • המרת עיצובים לקוד

    שחזור של שלדי אתרים ב־HTML ו־CSS ישירות מצילומי מסך של ממשק משתמש.

  • סוכני פעולה ויזואליים

    הפעלת פונקציות וכלים אוטומטיים שמקבלים צילומי מסך או תרשימים כקלט ישיר.

  • ניתוח מסמכים מורכבים

    עיבוד עשרות עמודים סרוקים שמכילים טבלאות, גרפים וטקסט בלי להפריד ביניהם.

איפה זה נופל

המפתחים מודים בעצמם שהמודל מתקשה במענה על שאלות טקסט טהורות שלא כוללות תמונה, כי כל המאמץ הלך לראייה. בנוסף, יש לו נטייה לחשוב יותר מדי, לחזור על עצמו או לחזור על התשובה שוב בסוף הפלט. הוא גם עדיין מועד בספירה מדויקת של פריטים בתמונה ובזיהוי של אנשים ספציפיים. שימו לב גם שהוא אומן על אנגלית וסינית בלבד, כך שלא כדאי לבנות עליו לפענוח מסמכים בעברית.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. אם תתנו לו מסמכים, ממשקים או תמונות עם טקסט בעברית, סביר מאוד שהוא יפספס או יחזיר ג׳יבריש.

האם כדאי להשתמש בו רק בשביל צ׳אט טקסטואלי רגיל?

ממש לא. היוצרים מציינים במפורש שיכולות הטקסט הנקי שלו חלשות ויש בהן פערים גדולים. הוא מיועד אך ורק למשימות שמשלבות ראייה ועיבוד תמונה.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט עשרים ג׳יגה בייט, כך שכדי להריץ אותו עצמאית תצטרכו כרטיס מסך מודרני עם לפחות עשרים וארבעה ג׳יגה בייט זיכרון גרפי, כמו כרטיס מהסדרה המקצועית או סדרה ארבעים העליונה. המפתחים תומכים בהרצה ישירה דרך vLLM או SGLang, שמתאים במיוחד לעיבוד וידאו, לצד ספריית transformers.

בסדרה הזו יש גם גרסה ענקית של מאה ושישה מיליארד פרמטרים שיושבת בענן. אם השרת המקומי שלכם חלש מדי להחזיק משקל כזה בזיכרון בזמן עומס, או שאתם לא רוצים לנהל תשתית יקרה בשביל כמה קריאות בודדות, עדיף להשתמש בגישת ה־API שהם מציעים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-4.6V-Flash")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. זה הרישיון הכי חופשי שיש, ואפשר להשתמש בו לפרויקטים מסחריים, לשנות את המשקלים, לשלב אותו במוצר פנימי או למכור שירות סביבו, כמעט בלי תנאים למעט שמירת קרדיט והצהרת אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗