GPT
L

layoutlm-base-uncased

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • layoutlm

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

עיבוד מסמכים סרוקים דורש הבנה של מיקום הטקסט בדף ולא רק את המילים עצמן. כאן מקבלים מודל שמחבר בין הטקסט למיקום המרחבי שלו בקובץ קל משקל.

  • 113Mפרמטרים
  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 137,965הורדות בחודש

מה זה

מיקרוסופט אימנו את המודל הזה על בסיס נתונים של 11 מיליון מסמכים מתוך מאגר IIT-CDIP. במקום להתייחס לטקסט כרצף שטוח, הוא משלב מידע טקסטואלי יחד עם קואורדינטות המיקום של המילים על גבי העמוד, מה שמאפשר לו לזהות מבנה של טפסים, טבלאות וקבלות.

עם 113 מיליון פרמטרים ו־12 שכבות, מדובר בגרסת הבסיס שנועדה למשימות סיווג וחילוץ מידע מתוך תמונות מסמכים. ההבדל בינו לבין מודלי שפה סטנדרטיים באותו סדר גודל טמון ביכולת לקרוא את הסידור החזותי, כך שערך שנמצא לצד תווית בטופס יקושר אליה נכון.

מתאים ל

  • חילוץ שדות מקבלות

    המודל מחבר בין שמות שדות כמו סכום או תאריך לבין הערכים שלהם לפי המיקום בדף.

  • הבנת טפסים סרוקים

    מתאים לזיהוי מבנה של טפסים רשמיים באנגלית שבהם המידע מסודר בתיבות או בעמודות.

  • סיווג סוגי מסמכים

    מאפשר למיין סריקות לפי הפריסה החזותית והתוכן הכתוב בלי להסתמך רק על מילים.

איפה זה נופל

המודל אומן רק על אנגלית ובפורמט uncased, כך שהוא מתעלם מאותיות גדולות וקטנות ולא מבין עברית בכלל. חלון ההקשר מוגבל ל־512 טוקנים, מה שאומר שמסמכים צפופים עם הרבה טקסט יחייבו אתכם לחתוך את הדף לחלקים או לוותר על תוכן. בנוסף, הוא דורש שתעבירו לו מראש את מיקומי המילים בעמוד, כך שתצטרכו מנוע זיהוי תווים חיצוני שיעשה את העבודה לפניו.

שאלות
נפוצות

האם המודל יודע לחלץ טקסט מתמונה בעצמו?

לא. המודל לא מחליף תוכנת זיהוי תווים אופטי, אלא מקבל את הטקסט ואת תיבות המיקום שלו מהמנוע שלכם ומנתח את הקשרים ביניהם.

אפשר להשתמש בו לניתוח מסמכים בעברית?

הוא אומן אך ורק על אנגלית ואינו תומך בעברית. כדי לעבוד עם שפות נוספות תצטרכו לחפש גרסה רב-לשונית או לאמן מודל אחר מאפס.

מה ההבדל בינו לבין גרסת ה־Large?

גרסת ה־Base כוללת 113 מיליון פרמטרים לעומת 343 מיליון בגרסה הגדולה. היא רצה הרבה יותר מהר, צורכת פחות זיכרון, ומתאימה למערכות שצריכות זמני תגובה קצרים.

איך מריצים

במשקל של 1.3 גיגה-בייט אפשר להריץ אותו כמעט על כל מעבד גרפי פשוט, ואפילו על מעבד רגיל של שרת בלי להיחנק. הוא נתמך ישירות בספריית transformers, כך שההטמעה שלו בקוד פייתוני קיימת ופשוטה.

אם יש לכם צורך בעיבוד כמויות קטנות מאוד ולא שווה להחזיק שרת דולק, קריאה לשירות ענן חיצוני תהיה זולה יותר. לכל נפח עבודה קבוע או רגישות לפרטיות של מסמכים, שווה להרים אותו עצמאית במכונה מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/layoutlm-base-uncased")
print(pipe("שלום"))

הרישיון

רישיון MIT נותן חופש כמעט מלא. מותר לשלב אותו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מיקרוסופט בתוך הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗