GPT
L

layoutlmv2-base-uncased

קוד פתוח

microsoftcc-by-nc-sa-4.02022-03-02

  • transformers
  • pytorch
  • layoutlmv2
  • en
  • endpoints_compatible

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שמחבר טקסט, תמונה ומיקום מרחבי של אלמנטים במסמך. תרצו אותו כדי לחלץ מידע מטפסים וחשבוניות באנגלית שבהם העיצוב הגרפי קובע את המשמעות.

  • 512טוקנים בהקשר
  • 765 MBמשקל הקבצים
  • 402,983הורדות בחודש
  • 68לייקים

מה זה

מיקרוסופט אימנה אותו לחלץ מבנה מתוך מסמכים סרוקים, כשהוא מקבל בו זמנית את הטקסט, התמונה והקואורדינטות של כל מילה. בניגוד למודלי שפה רגילים שמתעלמים לחלוטין מאיפה כל מילה יושבת בדף, הוא מבין ששדה שנמצא מימין לערך מסוים שייך אליו, גם בלי לקרוא את הטקסט ברצף ליניארי.

התוצאות במבחנים מראות שיפור ניכר מול הדור הראשון שלו במשימות כמו סיווג מסמכים, מענה על שאלות מתוך מסמכים ופענוח קבלות. במבחן DocVQA הוא קפץ מציון של 0.7295 ל־0.8672, ובמבחן הטפסים FUNSD הוא עלה מ־0.7895 ל־0.8420. זה מראה שהשילוב של התמונה עצמה בתוך המודל, ולא רק התיבות המתוחמות של הטקסט, באמת תופס היררכיה חזותית מורכבת.

מתאים ל

  • חילוץ נתונים מחשבוניות

    הוא מצטיין בקישור בין שדות לערכים בטבלאות ובקבלות באנגלית, לפי המיקום שלהם בדף.

  • סיווג טפסים סרוקים

    זיהוי סוג המסמך לפי המבנה החזותי והכותרות, מתאים לארכיונים עם סריקות מגוונות באנגלית.

  • מענה על שאלות מדוחות

    שליפת נתון בודד מתוך עמוד גרפי מורכב לפי שאלה ישירה, תוך שימוש בהקשר המרחבי.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים או לחוזים מרובי עמודים בלי לחתוך אותם מראש לחלקים קטנים. מעבר לזה, הוא אומן רק על אנגלית ומתעלם מאותיות גדולות וקטנות. אם המסמכים שלכם בעברית או כוללים שפות שאינן אנגלית, הוא פשוט לא יעבוד.

שאלות
נפוצות

האם המודל כולל רכיב OCR שמחלץ את הטקסט בעצמו?

לא. המודל מצפה לקבל את הטקסט והמיקומים שלו יחד עם תמונת המסמך. תצטרכו להפעיל כלי OCR נפרד לפני שמזינים אליו את הנתונים.

האם הוא יעבוד על חשבוניות וחוזים בעברית?

לא, המודל הזה הוגדר ואומן על השפה האנגלית בלבד. הרצה שלו על טקסט בעברית תניב תוצאות שגויות או כשלים בטוקניזציה.

איך מריצים

המשקל הכולל של הקבצים הוא 765 מגה בייט בפורמט של transformers, כך שאפשר להריץ אותו בקלות על כל מעבד גרפי צנוע או אפילו ישירות על מעבד רגיל של שרת. הוא לא דורש חומרת ענן כבדה או מקבצי שרתים מיוחדים כדי לתת זמני מענה סבירים.

עם זאת, הוא לא מודל שעובד לבד ישר מהקופסה. תצטרכו להזין לו גם את התמונה וגם את פלט הטקסט והמיקומים ממנוע זיהוי תווים חיצוני. אם אין לכם כבר תשתית OCR יציבה ומהירה בצינור הנתונים, עדיף לפעמים לפנות לממשקי ענן מוכנים שמבצעים את כל התהליך הזה בבקשה אחת.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/layoutlmv2-base-uncased")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 765 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא cc-by-nc-sa-4.0. המשמעות ברורה וחד משמעית, אסור להשתמש במודל הזה בשום מוצר מסחרי, יישום שמייצר הכנסה או שירות בתשלום. בנוסף, כל שינוי או נגזרת שלו מחייבים הפצה תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗