GPT
D

DocLayNet

קוד פתוח

docling-projectother2023-01-17

  • layout-segmentation
  • COCO
  • document-understanding
  • PDF

המאגר מרכז 80,863 עמודי מסמכים מסוגים שונים עם תיוג ידני של מקטעי עימוד בתיבות תוחמות. הוא מתאים למי שבונה מודלים לזיהוי מבנה מסמכים מורכבים מעבר למאמרים מדעיים רגילים.

  • 664הורדות בחודש
  • 147לייקים

מה זה

הנתונים מורכבים מעמודים בודדים שנאספו ממקורות ציבוריים בשש קטגוריות: דוחות כספיים, מאמרים מדעיים, חוקים ותקנות, מכרזים ממשלתיים, מדריכים טכניים ופטנטים. כל רשומה כוללת תמונת עמוד מרובעת בגודל 1025 על 1025 פיקסלים, קובץ PDF של העמוד, ותיוג בפורמט COCO שמגדיר תיבות תוחמות עבור 11 מחלקות שונות.

התיוג נעשה ידנית בידי בני אדם בעזרת הנחיות עבודה מוגדרות, כשחלק מהעמודים תויגו פעמיים או שלוש כדי למדוד אי ודאות ועקביות. בנוסף לתמונות ולתיבות, יש קובצי JSON שמכילים את תאי הטקסט הדיגיטליים, המיקום שלהם והתוכן המקורי. החלוקה המובנית לסט אימון, אימות ובחינה נקבעה מראש כדי למנוע זליגה של סגנונות עימוד דומים בין החלקים.

מתאים ל

  • פילוח עימוד מסמכים

    אימון מודלים לזיהוי 11 רכיבי מבנה שונים, כמו כותרות, טבלאות וטקסט רץ, בעמודים מורכבים.

  • חילוץ מידע מדוחות

    זיהוי תיבות טקסט לצד תוכן דיגיטלי מתוך קובצי PDF בדוחות כספיים ובמכרזים.

  • הערכת שגיאות תיוג

    בדיקת דיוק מודלים מול עמודים שכוללים תיוג אנושי כפול ומשולש כדי לקבוע חסם עליון לביצועים.

איפה זה נופל

הכרטיס מציין שהתיוג נעשה במיקור חוץ של בני אדם, מה שיוצר שונות מסוימת בהחלטות על גבולות הטקסט למרות ההנחיות. אין שום תיעוד של עברית או שפות שנכתבות מימין לשמאל, והדוגמאות בקבצים מתמקדות במסמכים באנגלית כמו דוחות נאסד"ק ומסמכים אמריקאיים. בנוסף, כל התמונות עברו כיווץ או מתיחה לממדים ריבועיים קבועים, כך שמסמכים מוארכים במקור עלולים לעוות פרופורציות.

אותה משפחה

DocLayNet יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, לפי כרטיס המאגר הנתונים מופצים ברישיון CDLA-Permissive-1.0. הרישיון הזה מתיר שימוש מסחרי ואימון מודלים, בתנאי ששומרים על הודעת הרישיון והייחוס ליוצרים.

האם הדאטהסט מתאים לעיבוד מסמכים בעברית?

הכרטיס אינו מזכיר עברית כלל וכולל בעיקר מסמכים באנגלית ובפורמטים מערביים. אפשר לנסות לאמן עליו מודל ויזואלי למבנה בלבד, אבל כדאי לבדוק אותו מראש על מסמכים מקומיים לפני שמסתמכים על התוצאות.

במה הוא שונה ממאגרים כמו PubLayNet?

הוא כולל שש קטגוריות מסמכים מגוונות ולא רק מאמרים רפואיים או מדעיים. בנוסף, הוא מבוסס על תיוג ידני אנושי עם 11 מחלקות עימוד, ולא על גזירה אוטומטית מקובצי מקור.

אילו קבצים מקבלים בכל רשומה?

כל עמוד מגיע כתמונת PNG בגודל קבוע, יחד עם קובץ PDF של אותו עמוד ואנוטציות COCO. בנוסף מצורף קובץ JSON עם נתוני תאי הטקסט הדיגיטליים והקואורדינטות שלהם.

איך טוענים

הטעינה נעשית דרך סקריפט הפייתון DocLayNet.py שבמאגר. הנתונים זמינים ישירות ללא צורך בהרשאת גישה מיוחדת, והם מחולקים מראש לסטים של אימון, אימות ובדיקה. כל תמונה מגיעה בגודל אחיד של 1025 על 1025 פיקסלים לצד אנוטציות בפורמט COCO רגיל, שכוללות שדות מותאמים כמו קטגוריית המסמך, שם הקובץ המקורי, מספר העמוד וסדר הקדימות במקרה של תיוג כפול.

from datasets import load_dataset

ds = load_dataset("docling-project/DocLayNet")

הרישיון

המטא דאטה מדווח על רישיון מסוג other, אבל הטקסט של הכרטיס מפרט רישיון CDLA-Permissive-1.0. הרישיון הזה מתיר שימוש מסחרי, שינוי ושיתוף של המידע, ללא דרישה להפיץ עבודות נגזרות באותו רישיון, ומחייב בעיקר שמירה על תנאי הרישיון והייחוס המקוריים.

הרישיון המלא ב־Hugging Face ↗