GPT
T

table-transformer-structure-recognition-v1.1-all

קוד פתוח

microsoftmit2023-11-18

  • transformers
  • safetensors
  • table-transformer
  • object-detection
  • endpoints_compatible

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זיהוי מבנה של טבלאות בתוך מסמכים הוא סיוט ידוע, והמודל הזה מפרק תמונות של טבלאות לתאים, שורות ועמודות. הוא שוקל מעט מאוד ומתאים למי שרוצה לפענח דוחות בלי להרים שרת יקר.

  • 29Mפרמטרים
  • 110 MBמשקל הקבצים
  • 264,287הורדות בחודש
  • 85לייקים

מה זה

מיקרוסופט אימנו את המודל הזה על בסיס ארכיטקטורת DETR המוכרת לזיהוי אובייקטים, תוך שימוש בנרמול מוקדם לפני שכבות הקשב. הוא אומן על שני מאגרי מידע גדולים של מסמכים, PubTables1M שמכיל מאמרים מדעיים ו־FinTabNet.c שמתמקד בדוחות פיננסיים. הייעוד שלו הוא לקבל תמונה של טבלה ולזהות את הרכיבים הפנימיים שלה כדי לאפשר שחזור של המבנה המקורי.

עם פחות מ־29 מיליון פרמטרים, מדובר במשקל נוצה מובהק. הוא לא מתחרה בענקי הראייה הממוחשבת הכלליים, אלא מתרכז לחלוטין במשימה של חיתוך גבולות תאים ושורות בתוך טבלה נתונה, מה שהופך אותו למהיר בהרבה לעומת פתרונות כבדים יותר.

מתאים ל

  • פירוק דוחות כספיים

    זיהוי שורות ועמודות במאזנים ודוחות רווח והפסד, תחום שבו המודל אומן מראש על מאגר ייעודי.

  • חילוץ טבלאות מ־PDF מדעי

    מיפוי תאים מתוך מאמרים סרוקים לצורך בניית מאגרי מידע טקסטואליים באופן אוטומטי.

  • צינור עיבוד מקומי

    שילוב בתוך מערכת סריקה פנימית שרצה על מעבד רגיל בלי תלות ברשת חיצונית.

איפה זה נופל

הצוות המקורי שפיתח את המודל במיקרוסופט לא טרח לכתוב עבורו כרטיס מודל, ואנשי האגינג פייס השלימו את המידע החסר. אין כאן נתוני דיוק רשמיים, מדדי ביצועים או פירוט על המגבלות שלו בכרטיס עצמו. הוא אומן בעיקר על דוחות כספיים ומאמרים מדעיים באנגלית, כך שהוא צפוי להסתבך מול טבלאות בכתב יד, צילומים עקומים או טבלאות בעברית עם יישור מימין לשמאל.

שאלות
נפוצות

האם הוא יודע לקרוא את הטקסט שבתוך התאים?

לא. מדובר במודל זיהוי אובייקטים בלבד, והוא רק מסמן איפה נמצאים התאים, השורות והעמודות בתמונה. כדי לקרוא את המלל עצמו תצטרכו להעביר את האזורים שהוא זיהה למנוע OCR נפרד.

האם הוא יעבוד טוב על טבלאות בעברית?

האימון התבצע על מאגרי מסמכים באנגלית כמו PubTables1M ודוחות פיננסיים באנגלית. המבנה הגיאומטרי עשוי להספיק לזיהוי קווים, אבל יישור מימין לשמאל ותבניות מקומיות עלולים לפגוע בדיוק הזיהוי ומחייבים בדיקה על הדאטה שלכם.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם המחלקה הייעודית לזיהוי אובייקטים של Table Transformer. קובץ המשקלים שוקל 110 מגה-בייט בלבד בדיוק של float32, כך שלא צריך כרטיס מסך מפלצתי ואפשר להריץ אותו בלי בעיה על מעבד רגיל בכל שרת פשוט או במחשב פיתוח מקומי.

אם אתם צריכים רק לעבד כמה מסמכים בודדים מדי פעם, עדיף להשתמש בממשק מוכן חיצוני ולא להתעסק בהקמת סביבה. הריצה המקומית משתלמת ברגע שיש לכם אלפי עמודים שרצים ברקע ואתם לא רוצים לשלם על כל קריאה לשירות ענן.

from transformers import pipeline

pipe = pipeline("object-detection", model="microsoft/table-transformer-structure-recognition-v1.1-all")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 110 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצר סגור ולהפיץ אותו ללקוחות בלי לשלם תמלוגים, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗