GPT
G

GLM-4.6V

קוד פתוח

zai-orgmit2025-12-07

  • transformers
  • safetensors
  • glm4v_moe
  • image-text-to-text
  • conversational

מודל ראייה ושפה ענק עם 108 מיליארד פרמטרים וארכיטקטורת MoE, שמיועד לסוכנים אוטונומיים. הוא מקבל תמונות ישירות לתוך הפעלת כלים ומחזיק חלון הקשר של 128 אלף טוקנים.

  • 108Bפרמטרים
  • 131,072טוקנים בהקשר
  • 201 GBמשקל הקבצים
  • 3,470הורדות בחודש

מה זה

המודל הזה משלב הבנה ויזואלית עמוקה עם הפעלת כלים ישירה. במקום להמיר תמונות לטקסט ואז לחפש פונקציה מתאימה, הוא מקבל צילומי מסך, תרשימים ומסמכים סרוקים ישר לתוך קריאות הפונקציה, ויודע לנתח גם את הפלט הוויזואלי שחוזר מהן.

הוא מתמודד עם מסמכים ארוכים ומורכבים עד 128 אלף טוקנים כשהם מוגשים כרצף תמונות, ומפענח טבלאות, עיצוב וגרפים בלי צורך בפיענוח מקדים. תכונה בולטת נוספת היא שחזור ממשקי משתמש, שבהם הוא ממיר צילום מסך לקוד HTML ו־CSS ומאפשר לבצע עליו שינויים בהוראות טקסט.

בגרסה הזו יש שילוב של יכולות יצירת תוכן שבו תמונות וטקסט נשזרים יחד, כולל פנייה עצמאית לכלי חיפוש כדי להביא מידע ודימויים תוך כדי ריצה.

מתאים ל

  • סוכני בדיקות ותפעול תוכנה

    הוא מפעיל כלים ישירות מתוך צילומי מסך ויודע לקרוא את התוצאה הגרפית שחוזרת מהממשק.

  • ניתוח דוחות עמוסי גרפים

    חלון של 128 אלף טוקנים מאפשר לבלוע עשרות עמודי PDF סרוקים יחד עם טבלאות ותרשימים.

  • תרגום עיצוב לקוד

    הוא קורא צילום מסך של ממשק משתמש ופולט קוד HTML ו־CSS תואם לעיצוב המקורי.

איפה זה נופל

היוצרים מודים במפורש שהביצועים בשאלות ותשובות של טקסט בלבד עדיין דורשים שיפור ניכר, כי המאמץ הושקע בעולם הוויזואלי. בנוסף, יש לו נטייה לחשיבת יתר, חזרתיות בפרומפטים מורכבים וחזרה מיותרת על התשובה בסוף הפלט. הוא גם מתקשה בדיוק בספירת עצמים ובזיהוי אנשים ספציפיים, והוא תומך רק באנגלית ובסינית, כך שאינו מתאים לעבודה בעברית.

שאלות
נפוצות

האם כדאי להשתמש בו למשימות עיבוד טקסט בלבד?

לא. המפתחים מציינים במפורש שיכולות הטקסט הטהור שלו מפגרות מאחור ושהאימון התמקד במשימות מולטימודליות. למשימות שאינן כוללות תמונות או מסמכים ויזואליים עדיף לבחור מודל שפה ייעודי.

האם המודל מתאים למוצר שפונה לקהל ישראלי?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. בלי תמיכה רשמית בעברית, כל ניסיון לעבד טקסט מקומי יוביל לתוצאות גרועות או לשגיאות פענוח, ולכן הוא אינו מתאים למוצרים בעברית.

איך מריצים

עם 51 קבצים במשקל כולל של 201 גיגה בייט ו־108 מיליארד פרמטרים, אי אפשר להריץ אותו על שרת פשוט. תצטרכו שרת ייעודי מרובה כרטיסי GPU חזקים עם מאות גיגה בייט של זיכרון גרפי, תוך שימוש במנועים כמו vLLM או SGLang שנתמכים רשמית בהגדרות שלו.

אם אין לכם קלאסטר כזה בענן או בדאטה סנטר, עדיף לפנות לגרסת ה־Flash הקטנה בעלת 9 מיליארד פרמטרים, או להשתמש ב־API של המפתחים. להרים מפלצת כזו לבד שווה רק אם אתם חייבים שהמידע הרגיש יישאר אצלכם ברשת הפנימית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-4.6V")
print(pipe("שלום"))

הקבצים

51 קבצים במאגר, 201 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, אחד החופשיים והפשוטים שיש. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗