GPT
P

pix2struct-docvqa-base

קוד פתוח

googleapache-2.02023-03-21

  • transformers
  • pytorch
  • safetensors
  • pix2struct
  • image-text-to-text

מענה על שאלות ישירות מתוך מסמכים סרוקים בלי לעבור דרך מנוע OCR נפרד. הפתרון מיועד למי שמחפש מודל קל משקל שקורא פיקסלים ומחזיר טקסט ישיר.

  • 282Mפרמטרים
  • 2.1 GBמשקל הקבצים
  • 1,273הורדות בחודש
  • 43לייקים

מה זה

במקום להריץ צינור עיבוד שמורכב מזיהוי תווים ואז מודל שפה, המודל הזה מקבל את תמונת המסמך יחד עם השאלה שמוטבעת עליה ופולט תשובה ישירה בטקסט. הוא מבוסס על ארכיטקטורת קידוד תמונה ופענוח טקסט, כשהאימון המקדים שלו התבצע על צילומי מסך ותרגומם למבנה של HTML פשוט.

הגרסה הזו עברה התאמה ייעודית למשימות שאלות ותשובות על מסמכים סרוקים. המבנה שלו מאפשר לטפל ברזולוציות משתנות של תמונות, מה שחוסך עיוותים של טפסים ומסמכים מורכבים. עם 282 מיליון פרמטרים, הוא תופס מעט מאוד זיכרון בהשוואה למודלי ראייה מודרניים גדולים, ומתאים לריצה מקומית צפופה.

מתאים ל

  • שליפת שדות מטפסים

    חילוץ תאריכים, סכומים ושמות מתוך מסמכים סרוקים באנגלית בלי להגדיר תבניות קבועות מראש.

  • תשאול חשבוניות לועזיות

    מתן מענה לשאלות נקודתיות על חשבוניות וקבלות ישירות מתמונה, ללא צורך בשכבת OCR נפרדת.

  • עיבוד מקומי ומאובטח

    קריאת מסמכים רגישים על שרת פנימי של החברה במקרים שבהם אסור להוציא תמונות לשרותי ענן חיצוניים.

איפה זה נופל

האימון נעשה בעיקר על אנגלית, צרפתית, רומנית וגרמנית, כך שהוא לא מיועד למסמכים בעברית או לכיווניות מימין לשמאל. בנוסף, מדובר במודל ממרץ 2023 עם 282 מיליון פרמטרים בלבד, לכן הוא יתקשה בהבנת שאלות מורכבות שדורשות הסקת מסקנות מעבר לשליפת נתון ברור שמופיע במסמך.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

לא. המודל אומן על שפות כמו אנגלית, צרפתית וגרמנית, ואינו כולל תמיכה באותיות עבריות או בניתוח טקסט מימין לשמאל.

האם אני חייב מנוע OCR נפרד כדי להשתמש בו?

לא. הרעיון במודל הוא קריאה ישירה של הפיקסלים בתמונה, כך שהוא מחליף גם את שלב זיהוי התווים וגם את שלב המענה.

באיזו חומרה כדאי להשתמש בייצור?

בגלל גודלו הקטן, כרטיס מסך פשוט וזול עם כמה גיגה בייט של זיכרון יספיק כדי לקבל קצב עיבוד גבוה ויציב.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.1 גיגה בייט בפורמט float32, כך שכל כרטיס מסך בסיסי עם 4 עד 6 גיגה בייט זיכרון יריץ אותו בלי מאמץ דרך ספריית transformers. הוא ירוץ גם על מעבד רגיל אם אין לכם דרישות זמני תגובה של אלפיות שניה.

אם אתם צריכים רק לבדוק שאילתות בודדות או לעבד מסמך פעם ביום, אין טעם להקים שרת ייעודי בשבילו. מצד שני, אם אתם בונים מערכת שמעבדת אלפי חשבוניות ורוצים שליטה במידע בלי לשלם על כל קריאת ענן, הגודל שלו מאפשר הרצה פנימית זולה מאוד.

from transformers import pipeline

pipe = pipeline("visual-question-answering", model="google/pix2struct-docvqa-base")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. אפשר לשנות את הקוד והמשקלים, להטמיע אותו בתוך מוצר סגור ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗