GPT
G

GLM-OCR

קוד פתוח

zai-orgmit2026-01-30

  • transformers
  • safetensors
  • glm_ocr
  • image-text-to-text
  • conversational

מודל ראייה קומפקטי של 1.3 מיליארד פרמטרים שמפענח מסמכים מורכבים ישירות לטקסט ולמבנה. הוא מציע פתרון מקומי מהיר וזול לחילוץ מידע מדויק מתמונות ומקובצי PDF.

  • 1.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 2,024,792הורדות בחודש

מה זה

במקום להריץ מודל ענק וכבד לכל סריקה פשוטה, כאן יש שילוב של אנקודר תמונה CogViT עם דקודר שפה של GLM בגודל חצי מיליארד פרמטרים. המבנה הזה מחבר בין ניתוח שטח המסמך לבין חילוץ טקסט רציף, נוסחאות מתמטיות וטבלאות מורכבות. במבחן OmniDocBench V1.5 הוא מציג ציון של 94.62, מה שמציב אותו במקום הראשון במדד המסוים הזה ביחס לכלים מתחרים.

היתרון המרכזי מול מודלים אחרים במשקל נוצה הוא מהירות העיבוד. בבדיקות של המפתחים הוא מגיע לקצב של 1.86 עמודים לשנייה בקובצי PDF וקרוב לשני שליש תמונה בשנייה, כשהוא פועל בתהליך יחיד. הוא מתמודד ישירות עם חותמות, קטעי קוד ותרשימים צפופים בלי להתפרק במעבר לשורות הבאות.

מתאים ל

  • המרת מאמרים לטקסט

    זיהוי משולב של נוסחאות מתמטיות, קטעי קוד ותרשימים ישירות מדפי PDF מדעיים.

  • חילוץ מובנה מטפסים

    שליפת פרטים מתעודות וקבלות ישירות לפורמט JSON מוגדר מראש.

  • פיענוח טבלאות סרוקות

    התמודדות עם מבני טבלאות מורכבים ומסמכים צפופים תוך שמירה על הסדר המקורי.

איפה זה נופל

המודל מוגבל לשני מצבי עבודה בלבד לפי הנחיות מוגדרות מראש, פיענוח כללי או חילוץ מידע לפי מבנה JSON קשיח. אם תסטו מהתבנית המדויקת, התוצאה תשבר. בנוסף, רשימת השפות הרשמית כוללת שמונה שפות בלבד, ביניהן סינית, אנגלית, צרפתית וספרדית. עברית לא נכללת ברשימה, ולכן לא הייתי בונה עליו לחילוץ מסמכים ישראליים בלי לבדוק קודם אם הוא בכלל מזהה את האותיות.

שאלות
נפוצות

האם המודל מתאים לזיהוי מסמכים בעברית?

השפות שנתמכות רשמית בכרטיס המודל הן אנגלית, סינית, צרפתית, ספרדית, רוסית, גרמנית, יפנית וקוריאנית בלבד. עברית לא מופיעה ברשימה, ולכן סביר מאוד שהוא יתקשה או ייכשל לחלוטין בטקסטים מקומיים.

האם חייבים להשתמש ב־SDK הרשמי כדי לקבל תוצאות טובות?

לא חובה, אפשר להריץ אותו ישירות דרך Ollama או vLLM לחילוץ פשוט. ה־SDK שלהם פשוט מוסיף שכבה שמנתחת את מבנה העמוד בעזרת כלי חיצוני לפני הפיענוח, מה שעוזר במסמכים מרובי עמודות וטבלאות.

איך מריצים

המשקל הכולל של הקבצים מגיע לשניים וחצי גיגה בייט בלבד, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי עם שמונה גיגה זיכרון, או ישירות דרך Ollama, vLLM ו־SGLang. מי שבונה צינור עיבוד מלא יעדיף להשתמש בערכת הפיתוח הרשמית שלהם, שמחברת גם את PP-DocLayout-V3 לטובת חלוקת המסמך לחלקים לפני הקריאה.

אם כל מה שצריך זה לחלץ שדות ספציפיים מדי פעם, שווה לשקול קריאה לשירות ה־API המוכנה של החברה ולחסוך תחזוקת שרת. לעומת זאת, לעיבוד מאסיבי של אלפי מסמכים ביום בארגון, הרצה מקומית על שרת פרטי תהיה זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="zai-org/GLM-OCR")
print(pipe("שלום"))

הרישיון

הקוד ומשקולות המודל מופצים תחת רישיון MIT, שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי והפצה ללא תמלוגים. אם אתם משתמשים בכל הצינור הרשמי יחד עם PP-DocLayout-V3, שימו לב שהחלק ההוא יושב תחת רישיון Apache 2.0, כך שיש לעמוד בתנאי שני הרישיונות יחד כשמוציאים מוצר לשוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗