GPT
D

donut-base-finetuned-docvqa

קוד פתוח

naver-clova-ixmit2022-07-19

  • transformers
  • pytorch
  • vision-encoder-decoder
  • image-text-to-text
  • donut

מענה על שאלות מתוך תמונות של מסמכים בלי לעבור קודם דרך מנוע OCR נפרד. הוא קורא את הפיקסלים ישירות ומייצר תשובה טקסטואלית קצרה.

  • 771 MBמשקל הקבצים
  • 24,959הורדות בחודש
  • 281לייקים

מה זה

מדובר במודל שמחבר מקודד תמונה מסוג Swin Transformer ישירות למפענח טקסט מסוג BART. במקום לחלץ טקסט עם כלי OCR ואז להריץ עליו מודל שפה, המקודד מקבל את התמונה של המסמך, מייצר ממנה ייצוג וקטורי, והמפענח פולט את התשובה מילה אחרי מילה.

הגרסה הזו אומנה ספציפית על מאגר DocVQA, כלומר שאלות ותשובות ויזואליות על גבי מסמכים כמו טפסים, קבלות ודוחות. המשקל הכולל של הקבצים עומד על 771 מגה בייט, כך שמקבלים כלי קומפקטי יחסית שלא דורש תחזוקה של שני מנועים נפרדים בעיבוד המסמך.

מתאים ל

  • מענה לשאלות על טפסים

    שליפת נתונים מתוך שדות מוגדרים בטופס ישירות מהתמונה בלי להגדיר חוקי חיתוך ידניים.

  • תחקור חשבוניות סרוקות

    שאילת שאלות ישירות על סכומים, תאריכים ושמות ספקים מתוך קובצי תמונה של קבלות.

  • פייפליין ללא מנוע OCR

    צמצום תלויות במערכת על ידי דילוג על מנוע זיהוי תווים חיצוני ומעבר ישר מתמונה לתשובה.

איפה זה נופל

הכרטיס מודה בפירוש שצוות הפיתוח המקורי לא כתב תיעוד מלא למודל הזה, והוא הועלה על ידי אנשי Hugging Face. הוא מותאם ספציפית למבנה של מאגר DocVQA, כך שאם המסמכים שלכם שונים משמעותית או דורשים שפות שאינן אנגלית, תצטרכו לבדוק היטב אם הוא מזהה את הנתונים ולא ממציא תשובות. בנוסף, הקבצים שמורים בפורמט float32 ולא מוגדרים מראש בדיוק מופחת.

שאלות
נפוצות

האם הוא צריך מנוע OCR כמו Tesseract מותקן ברקע?

לא. הארכיטקטורה עובדת ישירות על פיקסלים ומפענחת טקסט בלי שום מנוע זיהוי תווים חיצוני בשרת.

האם המודל מתאים לעבודה עם מסמכים בעברית?

הוא אומן על DocVQA שמבוסס על אנגלית. אם תזינו לו מסמכים בעברית סביר מאוד שהוא ייכשל, אלא אם תאמנו אותו מחדש על דאטה מתאים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בעזרת VisionEncoderDecoderModel. בגלל המשקל הנמוך שלו, אפשר להריץ אותו להסקה בקלות על גבי כרטיס מסך בסיסי עם מעט זיכרון, ואפילו על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

אם יש לכם שרת מקומי קטן או צורך בעיבוד פנימי של מסמכים רגישים, הרצה עצמית כאן פשוטה מאוד ולא דורשת תשתיות כבדות. שירותי ענן חיצוניים יהיו עדיפים רק אם אתם צריכים לטפל באלפי מסמכים במקביל ואין לכם כוח לנהל תור משימות.

from transformers import pipeline

pipe = pipeline("document-question-answering", model="naver-clova-ix/donut-base-finetuned-docvqa")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהריץ אותו בכל תשתית שתבחרו. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗