GPT
L

layoutxlm-base

קוד פתוח

microsoftcc-by-nc-sa-4.02022-03-02

  • transformers
  • pytorch
  • layoutlmv2
  • endpoints_compatible

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

פתרון מולטימודלי לעיבוד מסמכים סרוקים שמשלב טקסט, תמונה ומיקום במרחב בעשרות שפות. הוא מתאים למי שצריך לחלץ מידע מטפסים וחשבוניות בשפות שונות בלי להסתמך רק על אנגלית.

  • 514טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 221,119הורדות בחודש
  • 75לייקים

מה זה

מדובר בגרסה רב לשונית של LayoutLMv2, שפותחה כדי להתמודד עם מסמכים סרוקים עשירי מבנה כמו חשבוניות, קבלות וטפסים רשמיים. בניגוד למודלי שפה רגילים שרואים רק מחרוזת טקסט שטוחה, הוא קורא במקביל את תוכן הטקסט, את הפיקסלים של התמונה ואת המיקום הגיאומטרי של כל מילה בעמוד דרך תיבות תוחמות.

לפי המפתחים שלו, הוא עקף את מודלי הבסיס הקודמים במבחני XFUND, מה שאומר שהוא מחזיק בהבנה טובה יותר של קשרים מרחביים בין שדות לערכים על פני שפות שונות. אם אתם מעבדים מסמכים שאינם באנגלית וזקוקים לשמירה על הקשר שבין המיקום הפיזי של התווית לבין התוכן שלה, זו בדיוק הנקודה שבה הוא אמור לתת מענה עדיף על פני מודלי שפה רגילים.

מתאים ל

  • חילוץ שדות מטפסים רב לשוניים

    שיוך מדויק בין תוויות לערכים בטפסים בשפות שונות, בזכות השילוב של מיקום המילים בעמוד.

  • סיווג מסמכים סרוקים

    זיהוי סוג המסמך על פי המבנה החזותי והטקסטואלי שלו יחד, גם כשהתבנית משתנה.

  • מחקר אקדמי על עיבוד מסמכים

    בדיקת יכולות הבנת מבנה מרחבי בשפות שונות תחת רישיון פתוח למחקר שאינו מסחרי.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים בלבד. זה אומר שמסמכים ארוכים, חוזים מרובי עמודים או אפילו עמוד בודד עם מלל צפוף מדי ייחתכו, ותצטרכו לפצל אותם ידנית ולחבר את התוצאות. בנוסף, המודל תלוי לחלוטין באיכות ה־OCR שתספקו לו. טעות בזיהוי הטקסט או במיקום התיבות בקלט תגרור פגיעה ישירה בניתוח.

שאלות
נפוצות

האם המודל מקבל קובץ פי די אף או תמונה ומחזיר ישירות טקסט?

לא. המודל מצפה לקבל את הטקסט שכבר חולץ, את הקואורדינטות של כל מילה ואת התמונה עצמה. תצטרכו להפעיל מנוע זיהוי תווים חיצוני לפני ששולחים את המידע אליו.

אפשר להשתמש במודל הזה במוצר של הסטארטאפ שלי?

לא. הרישיון אוסר על שימוש מסחרי מכל סוג שהוא. כדי לבנות מוצר מסחרי תצטרכו לחפש חלופה עם רישיון מתאים כמו אפאצ'י או MIT.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.4 גיגה בייט בפורמט של ספריית transformers, עם 12 שכבות. זה גודל נוח מאוד שרץ בלי בעיה על מעבד גרפי ביתי פשוט או אפילו על מעבד רגיל של שרת, בלי לדרוש משאבי מחשוב כבדים במיוחד.

ההפעלה שלו דורשת הכנה מוקדמת, כי אי אפשר סתם לזרוק אליו טקסט. צריך להריץ מנוע זיהוי תווים אופטי כדי לחלץ את המילים והקואורדינטות שלהן, להכין את התמונה, ורק אז להזין הכל יחד למודל. אם אין לכם תשתית מוכנה לעיבוד תמונה וקואורדינטות, השימוש בו ידרוש עבודת פיתוח נוספת מסביב.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/layoutxlm-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות פשוטה: אסור להשתמש במודל הזה לצרכים מסחריים, נקודה. אם אתם בונים מוצר רווחי או כלי פנימי לחברה עסקית, אתם מפרים את תנאי השימוש. כל שימוש מותר למחקר או פיתוח לא מסחרי מחייב גם שיתוף תחת אותו רישיון ומתן קרדיט ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗