GPT
L

layoutlmv3-base-chinese

קוד פתוח

microsoftcc-by-nc-sa-4.02022-06-16

  • transformers
  • pytorch
  • layoutlmv3
  • zh
  • endpoints_compatible

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל מולטימודלי של מיקרוסופט לעיבוד מסמכים בסינית, שמנתח טקסט יחד עם המבנה החזותי של הדף. שווה לבדוק אותו רק אם אתם עובדים עם טפסים או קבלות בסינית.

  • 514טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 4,825הורדות בחודש
  • 83לייקים

מה זה

מדובר במודל שמחבר תמונה וטקסט בתוך ארכיטקטורת שנאי אחת של 12 שכבות, במקום לנתח כל רכיב בנפרד ואז לנסות להדביק את המידע. הוא מאומן על מיסוך משותף של מקטעי תמונה ומילים, מה שמאפשר לו להבין איפה כל שדה יושב ביחס לשאר האלמנטים בדף. זה שימושי במיוחד כשמנסים לחלץ מידע מטפסים, להבין קבלות, לענות על שאלות ויזואליות מתוך מסמך, או לסווג פריסה גרפית.

במדדי ההערכה שמיקרוסופט מציגה, הוא מגיע לציון F1 של 0.9202 במבחן XFUND למסמכים בסינית, עם דיוק של 0.898 וריקול של 0.9435. במבחן EPHOIE, שבודק חילוץ שדות ספציפיים מתוך טפסים כמו תעודות ושאלונים, הוא מציג ממוצע מרשים של 99.21, כולל דיוק מושלם בחילוץ זמני מבחן או מספרי כיתה ומושב. המספרים האלה מראים שהוא יודע לאתר ישויות מוגדרות היטב בלי לפספס הרבה, לפחות על דפי מבחן מובנים בסינית.

מתאים ל

  • חילוץ שדות מטפסים בסינית

    הוא מזהה שמות, ציונים ומספרים מזהים בדיוק גבוה מאוד לפי המיקום שלהם בדף.

  • סיווג מבנה של חשבוניות

    החיבור בין הטקסט למיקום הפיזי מאפשר להבדיל בין שורות פריט לסיכומי תשלום.

  • מחקר אקדמי על מסמכים

    הרישיון הלא מסחרי מתאים לבדיקת שיטות ניתוח מולטימודליות על סטים סיניים.

איפה זה נופל

המגבלה הכי קשה כאן היא חלון ההקשר, שעומד על 514 טוקנים בלבד. אי אפשר לזרוק עליו מסמכים ארוכים או חוזים מרובי עמודים, אלא רק דפים בודדים, חשבוניות או טפסים ממוקדים. בנוסף, הוא מאומן רק על השפה הסינית, כך שאם המסמך שלכם משלב אנגלית בצורה כבדה או שפות אחרות, הביצועים שלו עלולים להיפגע. הוא גם דורש אימון נוסף למשימה הספציפית שלכם כדי להגיע לתוצאות טובות באמת.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחילוץ מסמכים בעברית?

לא. המודל אומן ספציפית לשפה הסינית בלבד, והוא לא יזהה תווים או מבנים בעברית. בשביל עברית תצטרכו מודל רב לשוני או כזה שעבר אימון ייעודי.

האם אפשר להריץ אותו ישר מהקופסה על טפסים שלי?

מדובר במודל בסיס שעבר אימון מקדים כללי. כדי להוציא ממנו תוצאות טובות על טפסים אמיתיים, תצטרכו לאמן אותו מחדש על דאטה מתויג מהסוג שאתם רוצים לעבד.

איך מריצים

המודל שוקל 1.0 ג'יגה בייט בפורמט float32 ורץ דרך ספריית transformers הרגילה של פייתון. בגלל המשקל הקטן יחסית, הוא לא דורש שרתים מנופחים ויכול לרוץ בקלות על מעבד גרפי צנוע עם מעט זיכרון, או אפילו על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

אם אתם צריכים להריץ קריאות בודדות פעם ב, שירות מנוהל בצד עשוי לחסוך תחזוקה. אבל במקרה של עיבוד מסמכים שוטף ומקומי, הגודל הזה הופך את ההרצה העצמית לפשוטה וזולה מאוד לתפעול בלי תלות בגורם חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/layoutlmv3-base-chinese")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC-SA 4.0, וזה אומר שאסור להשתמש במודל הזה לכל מטרה מסחרית. מעבר לזה, אם אתם משפרים אותו או בונים עליו משהו, אתם חייבים לתת קרדיט למיקרוסופט ולשחרר את התוצר תחת אותו הרישיון בדיוק. לחברות שמחפשות לשלב אותו במוצר שמייצר הכנסה, הוא פשוט חסום משפטית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗