GPT
Y

yolov8m-table-extraction

קוד פתוח

keremberkeagpl-3.02023-01-29

  • ultralytics
  • tensorboard
  • v8
  • ultralyticsplus
  • yolov8

המודל מזהה מיקומי טבלאות בתוך מסמכים ותמונות ומסווג אותן לשני סוגים. הוא שוקל רק חמישים מגה בייט ומיועד למי שצריך שלב זיהוי ויזואלי מהיר לפני חילוץ הנתונים עצמם.

  • 50.0 MBמשקל הקבצים
  • 73,320הורדות בחודש
  • 44לייקים

מה זה

מי שאימן את המודל לקח את ארכיטקטורת YOLOv8 בגרסת מדיום והגדיר אותה למשימה אחת בלבד, איתור טבלאות. הפלט כולל תיחום של הטבלה בעמוד וסיווג לאחת משתי קטגוריות: טבלה עם קווי גבול ברורים, או טבלה ללא קווי מתאר שבה הטקסט מסודר בטורים ורווחים בלבד.

בכרטיס המודל אין מדדי ביצועים כמו ממוצע דיוק או תוצאות על סטים סטנדרטיים, כך שאי אפשר לדעת מראש איך הוא מתמודד עם עמודים צפופים ביחס לגרסאות אחרות. כל מה שיש כאן זה משקל קל מאוד, חמישים מגה בייט על הדיסק, ויכולת להריץ זיהוי זריז שמוצא איפה הטבלה יושבת לפני ששולחים את האזור לקריאת OCR מלאה.

מתאים ל

  • קדם עיבוד ל־OCR

    איתור אזורי הטבלאות בדף וחיתוך שלהם לפני שליחה לפענוח טקסט ייעודי.

  • מיון סוגי מסמכים

    זיהוי אוטומטי אם עמוד מכיל מידע טבלאי מובנה עם גבולות או ללא קווים.

  • חיתוך טבלאות מקומי

    ריצה מקומית על שרת פנימי כשרוצים לחסוך עלויות של שירותי ענן יקרים.

איפה זה נופל

הוא לא מחלץ נתונים, לא מזהה עמודות ולא קורא את הטקסט שבפנים, אלא רק מסמן ריבוע סביב הטבלה ומנחש אם יש לה גבולות או לא. מעבר לזה, הכרטיס לא מציין על איזה דאטה-סט בוצע האימון, מה שאומר שצריך לבדוק אותו עצמאית על סריקות עקומות, צילומי מסמכים בטלפון או דוחות בעברית לפני שבונים עליו.

שאלות
נפוצות

האם המודל מוציא קובץ אקסל או טקסט מתוך הטבלה?

לא. המודל מחזיר רק קואורדינטות של מיקום הטבלה בתמונה ואת הסוג שלה. כדי לקבל את המידע שבפנים תצטרכו להעביר את החיתוך לכלי OCR נפרד.

האם אפשר להשתמש בו במוצר מסחרי סגור בלי לחשוף קוד?

לא כדאי. רישיון AGPL מחייב שחרור של קוד המקור של היישום אם הוא מופעל כחלק משירות רשת. שימוש כזה במוצר קנייני ידרוש אישור משפטי או החלפה למודל עם רישיון מתירני יותר.

איך מריצים

כדי להריץ אותו מתקינים את החבילות ultralytics ו־ultralyticsplus בפייתון, טוענים את המשקלים ישירות ומעבירים תמונה לפונקציית החיזוי. המשקל הנמוך מאפשר להריץ אותו בלי בעיה על מעבד רגיל, כך שלא חייבים כרטיס מסך ייעודי כדי לקבל תוצאה במהירות סבירה.

אם אתם צריכים רק למצוא טבלאות בקבצים שלכם, אין שום סיבה לשלם ל־API חיצוני לפי עמוד. עם זאת, אם אתם צריכים גם לחלץ את הטקסט מתוך התאים ולא רק למצוא את המסגרת שלהם, תצטרכו לחבר למודל הזה מנוע פענוח נוסף או לפנות לשירות שלם שעושה את כל השרשרת.

pip install -U huggingface_hub
hf download keremberke/yolov8m-table-extraction

הקבצים

6 קבצים במאגר, 50.0 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא AGPL 3.0, וזה רישיון שמחייב זהירות רבה. אם אתם משלבים את הקוד הזה במערכת שמספקת שירות דרך הרשת, תצטרכו לפתוח את קוד המקור של כל המערכת שלכם תחת אותו רישיון חופשי, ולכן הוא בעייתי מאוד למוצרים מסחריים סגורים.

הרישיון המלא בעמוד המודל ↗