GPT
T

trocr-base-handwritten

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • vision-encoder-decoder
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

פתרון ראייה ממוחשבת שממיר תמונות של שורות בכתב יד לטקסט מוקלד. הבחירה בו הגיונית אם אתם מחפשים ארכיטקטורת שנאים מוכנה מבית מיקרוסופט בלי צורך ברכיבי ראייה ישנים.

  • 333Mפרמטרים
  • 2.5 GBמשקל הקבצים
  • 169,326הורדות בחודש
  • 517לייקים

מה זה

מדובר במודל שמחבר שני עולמות: מקודד תמונה שמבוסס על משקולות של BEiT ומפענח טקסט שמבוסס על RoBERTa. הוא שובר את התמונה למקטעים בגודל 16 על 16 פיקסלים, מעביר אותם דרך המקודד, והמפענח מייצר את המילים בצורה אוטורגרסיבית, אות אחר אות או טוקן אחר טוקן.

המשקולות הספציפיות האלו עברו כוונון עדין על גבי מאגר IAM, שהוא מאגר מוכר של כתב יד באנגלית. השילוב בין מודל ראייה מודרני למודל שפה חוסך את השימוש ברשתות קונבולוציה ו־RNN מסורתיות שהיו נהוגות במערכות OCR ישנות יותר.

מתאים ל

  • פענוח פתקים באנגלית

    הוא אומן על מאגר כתב יד ייעודי, ומצטיין בהמרת שורות בודדות מתוך מסמכים סרוקים.

  • שלב סופי במערכת OCR

    משתלב היטב אחרי שלב של זיהוי וחיתוך שורות, שבו צריך רק לקרוא את התוכן עצמו.

  • בסיס לכוונון עדין

    הארכיטקטורה המובנית שלו נוחה למי שרוצה לאמן מודל כתב יד על דאטה פנימי משלו.

איפה זה נופל

המגבלה הכי גדולה היא שהוא תוכנן לעבוד על שורת טקסט בודדת בלבד. אם תזרקו עליו עמוד שלם, צילום של טופס או פסקאות שלמות, הוא לא יידע מה לעשות ותצטרכו לחתוך את התמונה לשורות מראש. בנוסף, האימון נעשה על מאגר IAM באנגלית, כך שאין כאן תמיכה בעברית או בשפות אחרות מהקופסה בלי אימון נוסף.

שאלות
נפוצות

האם אפשר לתת לו לקרוא מסמך שלם של כמה עמודים?

לא ישירות. הכרטיס מציין במפורש שהמודל מיועד לשורות טקסט בודדות. תצטרכו להשתמש בכלי נפרד שיזהה איפה נמצאות השורות ויחתוך אותן אחת אחת לפני שתזינו אותן למודל.

האם הוא מזהה כתב יד בעברית?

לא. המשקולות האלו אומנו על מאגר IAM שמכיל אנגלית בלבד ומפענח הטקסט מבוסס על RoBERTa. כדי לעבוד בעברית תצטרכו לאמן אותו מחדש על נתונים מקומיים.

איך מריצים

טוענים את המשקולות דרך ספריית transformers באמצעות המחלקות TrOCRProcessor ו־VisionEncoderDecoderModel. עם 333 מיליון פרמטרים ומשקל קבצים של כ־2.5 גיגה בייט בפורמט float32, אפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי, ואפילו על מעבד רגיל אם הקצב פחות קריטי לכם.

הוא מתאים להרצה עצמית אם אתם מעבדים מסמכים רגישים שאסור להוציא לענן חיצוני, או אם יש לכם נפח עבודה קבוע שלא מצדיק תשלום לפי קריאה לשירותים מסחריים.

from transformers import pipeline

pipe = pipeline("image-to-text", model="microsoft/trocr-base-handwritten")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד אתם משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗