GPT
D

dit-base-finetuned-rvlcdip

קוד פתוח

microsoftרישיון לא דווח2022-03-07

  • transformers
  • pytorch
  • beit
  • image-classification
  • dit

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה ממוקד שמסווג תמונות של מסמכים לתוך 16 קטגוריות קבועות מראש. הוא עבר אימון ייעודי על מיליוני דפים, ולכן מבין מבנה של ניירת הרבה יותר טוב מסתם מודל תמונות כללי.

  • 333 MBמשקל הקבצים
  • 18,107הורדות בחודש
  • 40לייקים
  • 12שכבות

מה זה

הבסיס כאן הוא ארכיטקטורת BEiT עם 12 שכבות, שעברה אימון מקדים על מאגר IIT-CDIP שכולל 42 מיליון סריקות מסמכים. המודל מחלק כל דף למקטעים של 16 על 16 פיקסלים ולומד את היחסים ביניהם, בדומה לאופן שבו מודלי שפה מעבדים טקסט, רק על גבי תמונה ישירה בלי להריץ OCR קודם.

הגרסה הזו אומנה ספציפית על RVL-CDIP, דאטהסט שמכיל 400,000 מסמכים בגווני אפור. התפקיד שלה הוא לקחת קובץ תמונה ולהחזיר אחד מתוך 16 סיווגים אפשריים, כמו מכתב, חשבונית או טופס. אם אתם צריכים לחלק מסמכים נכנסים לערמות לפי סוג עוד לפני שמתחילים לחלץ מהם שדות, זה בדיוק מה שהוא יודע לעשות.

מתאים ל

  • מיון ראשוני של מסמכים

    ניתוב אוטומטי של סריקות נכנסות למחלקות המתאימות, לפי סוג הטופס עוד לפני שלב ה־OCR.

  • סינון קבצים בארכיון

    חלוקה מהירה של כמויות מסמכים סרוקים ישנים ל־16 הקטגוריות שעליהן המודל הוכשר.

  • בסיס לאימון נוסף

    שימוש במשקולות המאומנות מראש כדי לאמן סיווג על סוגי מסמכים ייחודיים לארגון שלכם.

איפה זה נופל

הבעיה המרכזית היא המטרה המאוד צרה שלו. הוא לא קורא טקסט, לא מחלץ נתונים, ולא יודע למצוא טבלאות, אלא רק לפלוט תווית אחת מתוך ה־16 שעליהן אומן. אם יש לכם מסמך שלא נופל בדיוק להגדרות של RVL-CDIP, תקבלו סיווג שגוי. בנוסף, הדאטהסט המקורי התבסס על 400 אלף תמונות ישנות בשחור-לבן, מה שאומר שמסמכים מודרניים, צבעוניים או סריקות עקומות מהטלפון עלולים לאתגר אותו, וצוות הפיתוח של מיקרוסופט אפילו לא טרח לכתוב לו כרטיס מודל מסודר.

שאלות
נפוצות

האם המודל מסוגל לחלץ שמות או סכומים מתוך הדף?

לא. המודל פועל כקלאסיפייר בלבד על בסיס תמונה ומחזיר תווית סיווג אחת מתוך 16 מחלקות. כדי להוציא תוכן טקסטואלי תצטרכו מודל OCR נפרד או מודל שמיועד למשימות layout analysis.

האם אפשר להריץ אותו ישירות על מעבד בלי כרטיס מסך?

כן, הקבצים שוקלים 333 מגה-בייט בלבד עם 12 שכבות transformer, כך שהוא קל מאוד לעיבוד. במחשב רגיל או בשרת סטנדרטי אפשר לקבל תגובה מהירה לכל תמונה בלי GPU ייעודי.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers עם המחלקות AutoImageProcessor ו־AutoModelForImageClassification. המשקל הכולל של הקבצים עומד על 333 מגה-בייט בלבד בדיוק float32, כך שאין שום צורך במערך שרתים מורכב.

כרטיס מסך בסיסי או אפילו מעבד רגיל של שרת יספיקו כדי להריץ עליו אינפרנס מהיר בלי צווארי בקבוק. בנפח כזה אין סיבה אמיתית לשלם על API חיצוני, כי הרבה יותר זול ופשוט להרים אותו מקומית בתוך הקוד שלכם.

from transformers import pipeline

pipe = pipeline("image-classification", model="microsoft/dit-base-finetuned-rvlcdip")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 333 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל לא דווח בעמוד שלו. כשאין רישיון מוגדר, מבחינה משפטית אין היתר שימוש ברור, מה שיוצר סיכון ממשי לכל מי שמתכנן לשלב אותו במוצר מסחרי. לפני שאתם דוחפים אותו לפרודקשן, תצטרכו לבדוק את תנאי המקור של הפרויקט בגיטהאב כדי להבין אם מותר להפיץ אותו.

הרישיון המלא בעמוד המודל ↗