GPT
D

DocLayNet-v1.1

קוד פתוח

docling-projectother2023-08-17

  • layout-segmentation
  • COCO
  • document-understanding
  • PDF

מאגר שמביא מעל 80 אלף עמודי מסמכים מתויגים ידנית לזיהוי מבנה ופריסה. מתאים למי שמאמן מודלים לחילוץ מקטעים מורכבים כמו טבלאות ונוסחאות ממסמכים אמיתיים.

  • 3,066הורדות בחודש
  • 27לייקים

מה זה

המאגר מכיל 80,863 עמודים ייחודיים שחולקו מראש לקבוצות אימון, ולידציה ובדיקה. כל רשומה מייצגת עמוד בודד וכוללת תמונת עמוד, תיחום תיבות, פוליגונים לסגמנטציה ותוכן תאי טקסט מתוך ה־PDF המקורי. התיוג בוצע ידנית וכולל 11 קטגוריות של אלמנטים גרפיים ומבניים, החל מכותרות וכותרות עליונות ועד טבלאות, איורים ונוסחאות.

המסמכים נאספו ממקורות ציבוריים ומשתייכים לשש קטגוריות שונות: דוחות פיננסיים, מאמרים מדעיים, חוקים ותקנות, מכרזים ממשלתיים, מדריכים טכניים ופטנטים. חלק מהעמודים תויגו פעמיים או שלוש בידי אנשים שונים, מה שמאפשר לבחון אי ודאות בתיוג אנושי. הגרסה הזו זונחת את פורמט COCO ומספקת ישירות את תאי הטקסט המשויכים לתיבות הגילוי.

מתאים ל

  • אימון מודלי סגמנטציה

    זיהוי אלמנטים ויזואליים ומבניים כמו טבלאות, כותרות ונוסחאות בעמודי מסמך.

  • חילוץ טקסט מבוסס מבנה

    שילוב גבולות התיבות עם תאי ה־PDF לטובת פירוק מסמכים לפי סדר קריאה הגיוני.

  • הערכת ביצועי מודלי OCR

    בדיקת איכות של מנועי זיהוי פריסה מול נתוני אמת מתויגים בידי אדם.

איפה זה נופל

התיוג מבוסס על עבודת אדם במיקור חוץ, ורמת הדיוק מוגבלת להנחיות שניתנו להם. המאגר נשען על מקורות פומביים באנגלית מקטגוריות מוגדרות בלבד. אם המוצר שלכם עוסק במסמכים בעברית, בחשבוניות סרוקות באיכות נמוכה או בחוזים מקומיים, הפריסה כאן לא בהכרח מייצגת ותדרוש איסוף דאטה נוסף.

אותה משפחה

DocLayNet יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, תנאי CDLA-Permissive-1.0 שמופיעים בכרטיס מתירים שימוש מסחרי. החובה העיקרית היא לשמור על הודעת הרישיון והקרדיט לצוות המחקר של IBM שפרסם אותו.

האם הדאטהסט כולל תמיכה במסמכים בעברית?

לא, המסמכים נאספו ממקורות בינלאומיים פומביים בשפה האנגלית. המבנה עשוי לסייע לעימוד לטיני, אך כיווניות מימין לשמאל ומאפייני פונטים בעברית אינם מיוצגים כאן.

באיזה פורמט מגיעים הנתונים והאם הם שמורים כ־COCO?

הגרסה הזו לא מגיעה בפורמט COCO הרגיל של הגרסאות הקודמות. הנתונים מוגשים בקובצי Parquet וכוללים ישירות תמונות, פוליגונים ותאי טקסט של PDF לצד מטא-דאטה על סוג המסמך.

מה היתרון המרכזי שלו מול סטים כמו PubLayNet?

התיוג כאן נעשה בידי אנשים ולא נוצר אוטומטית מקובצי מקור, ויש בו מגוון רחב יותר של שש קטגוריות מסמכים לעומת מאמרים רפואיים בלבד. בנוסף, הוא כולל 11 מחלקות מפורטות ומדידות של אי ודאות מתייגים.

איך טוענים

הנתונים מחולקים ל־36 קבצי Parquet שמתוכם 29 מוקצים לחלק האימון ושניים לבדיקה, לצד קובצי ולידציה. הגישה פתוחה ואינה דורשת אישור מיוחד. בכל דגימה תמצאו את שדה התמונה בפורמט PIL, שדות הקואורדינטות של התיבות והפוליגונים, ומערך תאי ה־PDF שמאפשר לחבר את התמונה ישירות לטקסט המקורי.

from datasets import load_dataset

ds = load_dataset("docling-project/DocLayNet-v1.1")

הרישיון

הרישיון המוגדר במטא-דאטה הוא other, אך הכרטיס מציין את CDLA-Permissive-1.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי ושיתוף של הנתונים, כל עוד שומרים על פרטי הרישיון המקוריים וייחוס ליוצרים. השימוש בדאטה לא כופה שחרור של המודלים המאומנים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗