GPT
D

donut-base-finetuned-cord-v2

קוד פתוח

naver-clova-ixmit2022-07-19

  • transformers
  • pytorch
  • vision-encoder-decoder
  • image-text-to-text
  • donut

קורא קבלות ישירות מתמונה ומחזיר טקסט בלי מנוע OCR נפרד באמצע. מתאים למי שרוצה חילוץ נתונים מקומי וקל בלי להסתבך עם חיבור כלים שונים.

  • 774 MBמשקל הקבצים
  • 9,482הורדות בחודש
  • 121לייקים

מה זה

מדובר במודל שמחבר מקודד ראייה מסוג Swin Transformer ישירות למפענח טקסט של BART. במקום לסרוק תמונה, לזהות קופסאות של מילים, להריץ עליהן זיהוי תווים ואז לנסות להבין את המבנה, הוא מקבל את התמונה הגולמית ופולט טקסט ברצף.

הגרסה הזו עברה אימון ייעודי על CORD, מאגר שמיועד לחילוץ מידע מקבלות ומסמכים דומים. ההבדל הגדול בינו לבין פתרונות מסורתיים באותו סדר גודל הוא הויתור המלא על מנועי זיהוי תווים חיצוניים, מה שחוסך שרשור שגיאות בין שלב הקריאה לשלב הפענוח של המסמך.

במשקל כולל של 774 מגה-בייט הוא נשאר קומפקטי מאוד ביחס ליכולת שלו להבין היררכיה חזותית של דף מודפס. המפתחים לא פירטו בכרטיס תוצאות מדידה מספריות, כך שהיכולת נשענת על ההתמחות הספציפית במבנה של קבלות מתוך המאגר המקורי.

מתאים ל

  • פענוח קבלות דיגיטלי

    חילוץ פריטים ומחירים מקבלות סרוקות ישירות לטקסט בלי צורך במנוע OCR נוסף.

  • אוטומציה לדוחות הוצאות

    שליפת סכומים ותאריכים ממסמכי רכישה קצרים על גבי חומרה מקומית וזולה.

  • עיבוד מקומי ומאובטח

    המרת תמונות חשבונית לטקסט בשרת פנימי שלא מוציא מידע רגיש לרשת.

איפה זה נופל

האימון נעשה על מאגר CORD בלבד, ולכן הוא מותאם במיוחד לקבלות וחשבוניות במבנה דומה. אם תזרקו עליו חוזים, תעודות מזהות או מסמכים עמוסי פסקאות, הוא יתקשה מאוד לחלץ מידע רלוונטי. הצוות המקורי שפיתח אותו לא השאיר תיעוד מפורט בכרטיס המודל, אלא הפנה למאמר בלבד, כך שאין כאן מידע רשמי על ביצועים מחוץ למאגר האימון. חובה לבדוק אותו על סריקות אמיתיות שלכם לפני שסומכים עליו בתהליך ייצור.

שאלות
נפוצות

איך המודל הזה עובד בלי OCR רגיל?

הוא מתבסס על ארכיטקטורת ראייה שסורקת את התמונה וממירה אותה לייצוג וקטורי פנימי. משם, מפענח טקסט מייצר את המילים ישירות מתוך המבנה החזותי של המסמך, בלי לעבור דרך קופסאות תווים.

האם הוא מתאים לקריאת חוזים ומסמכים ארוכים?

לא. הוא עבר אימון ייעודי על מאגר CORD שמכיל קבלות ורשימות קצרות, והוא אינו מתאים לטקסט חופשי או למסמכים משפטיים מורכבים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות VisionEncoderDecoderModel. קבצי המשקל תופסים 774 מגה-בייט בדיוק float32, כך שכל מעבד גרפי פשוט עם 4 גיגה זיכרון יריץ אותו בקלות, ואפשר להריץ אותו אפילו על מעבד רגיל של שרת מקומי בלי להרגיש חנק.

אם אתם מעבדים עשרות אלפי קבלות בחודש ושומרים על פרטיות המידע, אין סיבה לשלם ל־API חיצוני. לעומת זאת, אם המסמכים שלכם מורכבים יותר מקבלות או דורשים שפות מגוונות, כדאי לשקול מודל מולטימודלי רחב יותר בענן.

from transformers import pipeline

pipe = pipeline("image-to-text", model="naver-clova-ix/donut-base-finetuned-cord-v2")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לגמרי. מותר לקחת את המשקולות, להטמיע במוצר מסחרי, לערוך שינויים ולהפיץ מחדש בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של המפתחים המקוריים בתוך הקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗