GPT
L

layoutlmv3-large

קוד פתוח

microsoftcc-by-nc-sa-4.02022-04-18

  • transformers
  • pytorch
  • tf
  • layoutlmv3
  • en

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל רב־מודאלי לעיבוד מסמכים שמחבר בין הטקסט למיקום הוויזואלי שלו בדף. הוא מתאים למי שחייב לחלץ מידע מטפסים וקבלות מורכבות במקום לסמוך רק על טקסט גולמי.

  • 514טוקנים בהקשר
  • 2.7 GBמשקל הקבצים
  • 69,701הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל שמנתח מסמכים על ידי שילוב ישיר של מילים ותמונות תחת ארכיטקטורה אחידה. במקום להפריד בין פענוח הראייה הממוחשבת לבין הבנת השפה, הוא לומד את הקשר בין שניהם באמצעות מיסוך משותף של מקטעי תמונה וטקסט בזמן האימון.

הוא בנוי לטפל במשימות שבהן המבנה הפיזי של הדף קריטי להבנת המשמעות, כמו שדות בטפסים, ניתוח פריסה של מסמך סרוק, חילוץ פרטים מקבלות ומענה חזותי על שאלות מתוך תמונות של עמודים. אם הדפים שלכם כוללים טבלאות צפופות או עימוד לא שגרתי, הגישה הזו נותנת יתרון ברור על פני מודלי שפה רגילים שמתעלמים ממיקום המילים במרחב.

הגרסה הזו מכילה עשרים וארבע שכבות ומשקלה מגיע לשני ג'יגה־בייט ושבע מאות מגה־בייט, מה שמציב אותה כגרסה הכבדה והמדויקת יותר במשפחה לעומת מהדורות הבסיס. היא מאומנת על השפה האנגלית בלבד, ולכן הדגש כאן הוא על מסמכים מערביים ששומרים על כיווניות וכללי עימוד סטנדרטיים.

מתאים ל

  • חילוץ שדות מקבלות באנגלית

    שילוב הטקסט והמיקום מאפשר לשייך סכומים לתאריכים גם כשהעיצוב מורכב.

  • הבנת מבנה של טפסים

    זיהוי תיבות סימון, תוויות ושדות מילוי לפי המיקום החזותי שלהם בדף.

  • סיווג תמונות של מסמכים

    חלוקת דפים סרוקים לקטגוריות לפי הפריסה הגרפית ושורות הטקסט יחד.

איפה זה נופל

המגבלה הכי קשה כאן היא חלון הקשר של 514 טוקנים בלבד. אם יש לכם דף עמוס בטקסט, חשבונית ארוכה במיוחד או מסמך מרובה עמודים, לא תוכלו להכניס את כולו בבת אחת ותצטרכו לחתוך אותו למקטעים. בנוסף, המודל אומן על אנגלית בלבד. הוא לא מיועד לעברית, לא יודע להתמודד עם שפות מימין לשמאל, והכרטיס הרשמי שלו מציג רק אימון מקדים, מה שאומר שתצטרכו לאמן אותו בעצמכם על נתונים מתויגים לפני שתוכלו לקבל תוצאות שמישות במוצר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחילוץ נתונים מחשבוניות בעברית?

לא, המודל אומן על אנגלית בלבד ואינו תומך בעברית. מעבר למחסום השפה, הוא לא הוכשר על כיווניות של ימין לשמאל, כך שמיקומי המילים והסדר הלוגי שלהן ישתבשו לחלוטין בניתוח הדף.

האם המודל מוכן לעבודה מיד לאחר ההורדה?

לא, מדובר במודל בסיס שעבר אימון מקדים כללי בלבד. כדי להפיק ממנו ערך עבור משימה ספציפית כמו חילוץ טפסים או ניתוח קבלות, עליכם לבצע fine-tuning על דאטה־סט מתויג משלכם.

איך מריצים

המשקל יושב על קבצים בנפח של 2.7 גיגה־בייט בדיוק של float32, כך שתוכלו לטעון אותו ישירות דרך ספריית transformers לתוך כרטיס מסך מודרני עם שמונה גיגה־בייט זיכרון בלי מאמץ מיוחד. עבור הסקת מסקנות נקודתית אפשר להריץ אותו גם על מעבד רגיל, אבל כל אימון או התאמה אישית ידרשו מאיץ גרפי ייעודי כדי להתמודד עם גודל השכבות ועיבוד התמונה במקביל.

אם יש לכם צורך בעיבוד של אלפי דפים ביום ואין לכם שרת זמין עם כרטיס גרפי, העלות של תחזוקת תשתית עצמאית תהיה גבוהה. במקרים כאלה, או כשצריך לחלץ מידע מטפסים פשוטים מאוד בלי תלות במיקום, שווה לשקול פתרון מנוהל במקום להתעסק בהרצה מקומית של המודל הגדול.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/layoutlmv3-large")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 2.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, וזה אומר שאסור להשתמש במודל הזה לכל מטרה מסחרית. הוא מיועד למחקר, בדיקות ופיתוח פנימי בלבד. אם תיצרו גרסה מותאמת שלו, תהיו חייבים לשתף אותה תחת אותו רישיון בדיוק ולתת קרדיט למיקרוסופט. למוצר מסחרי שמוכר שירותים תצטרכו לחפש חלופה עם רישיון פתוח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗