GPT
G

glm-4v-9b

קוד פתוח

zai-orgother2024-06-04

  • transformers
  • safetensors
  • chatglm
  • glm
  • thudm

מודל ראייה ושפה שמביא ביצועים חזקים בניתוח מסמכים וגרפים ברזולוציה גבוהה. מתאים למי שרוצה חלופה מקומית למודלים סגורים באנגלית ובסינית.

  • 14Bפרמטרים
  • 25.9 GBמשקל הקבצים
  • 20,341הורדות בחודש
  • 268לייקים

מה זה

למרות השם שמרמז על תשעה מיליארד, בפועל מדובר על קרוב ל־14 מיליארד פרמטרים. הוא מטפל בתמונות ברזולוציה של 1120 על 1120 פיקסלים ותומך בחלון הקשר של 8K טוקנים לשיחות מרובות תורות.

החוזק העיקרי שלו, לפי המבחנים שמציגים המפתחים, נמצא בעיבוד טקסט ויזואלי ותרשימים. במבחן OCRBench הוא מציג ציון של 786, תוצאה שעוקפת אפילו את GPT-4o ודגמים ייעודיים אחרים, לצד ציון של 81.1 בהבנת דיאגרמות ב־AI2D. לעומת זאת, במבחנים רחבים יותר של ידע אקדמי רב־תחומי כמו MMMU, הוא משיג 47.2 ונשאר מאחורי המודלים המסחריים הגדולים.

מתאים ל

  • חילוץ מידע מדוחות וסריקות

    התוצאה הגבוהה במבחן OCRBench הופכת אותו למועמד מצוין לקריאת קבלות, טפסים ומסמכים סרוקים באנגלית.

  • ניתוח גרפים ותרשימים

    עם ציון של 81.1 ב־AI2D, הוא מתאים לפענוח ויזואלי של מצגות וגרפים טכניים ברזולוציה גבוהה.

  • שיחה מרובת תורות על תמונות

    תמיכה בחלון של 8K מאפשרת לתחקר תמונה אחת לאורך כמה שאלות והבהרות בלי לאבד את ההקשר.

איפה זה נופל

התמיכה מוגבלת רשמית לאנגלית וסינית בלבד, כך שאין מה לבנות עליו לעיבוד מסמכים או תמונות עם טקסט בעברית. בנוסף, במבחני ידע רב־תחומי והזיות הוא פחות יציב מהמודלים המסחריים המובילים, ודרושה בדיקה קפדנית אם המטרה היא הסקת מסקנות מורכבת ולא רק קריאת נתונים יבשים.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי טקסט בעברית מתוך תמונות?

המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד. הוא לא מיועד לעברית, ובקריאת טקסט עברי מסריקות סביר להניח שהוא ייכשל לחלוטין.

כמה זיכרון GPU צריך בשביל להריץ אותו?

המשקלים שוקלים כמעט 26GB בדיוק המקורי, ולכן דרוש כרטיס עם יותר מ־24GB VRAM, או שימוש בשיטות כיווץ והורדת דיוק כדי להריץ על כרטיסים צרכניים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 24GB זיכרון כדי לטעון את משקלי ה־bfloat16 שתופסים כמעט 26GB על הדיסק, או לעבור לקוונטיזציה אם רוצים לפנות מקום לעיבוד תמונות ופרומפטים ארוכים.

הוא עובד ישירות דרך ספריית transformers החל מגרסה 4.44.0. אם אין לכם חומרה ייעודית בענן או מקומית, עדיף להשתמש במודל מרוחק דרך API, במיוחד בהתחשב בכך שעיבוד תמונות כבדות יוצר צוואר בקבוק של זיכרון בריצה מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/glm-4v-9b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ תנאים ייעודי של המפתחים. זה אינו רישיון קוד פתוח סטנדרטי מסוג MIT או אפאצ'י, ולכן חובה לקרוא את מסמך הרישיון המקורי שלהם כדי לוודא אם ואיך מותר להשתמש בו לצרכים מסחריים.

הרישיון המלא בעמוד המודל ↗