GPT
D

DocLayNet-v1.2

קוד פתוח

docling-projectרישיון לא דווח2025-02-06

המאגר מכיל מעל 80 אלף עמודי מסמכים מתויגים ידנית לניתוח מבנה ויזואלי. הוא מיועד למי שבונה מודלים לחילוץ נתונים מדוחות, פטנטים ומסמכים מורכבים.

  • 4,378הורדות בחודש
  • 18לייקים

מה זה

הנתונים כוללים 80,863 עמודים ייחודיים שמחולקים לשישה תחומים ברורים: דוחות כספיים, מאמרים מדעיים, חוקים ותקנות, מכרזים ממשלתיים, מדריכים טכניים ופטנטים. המקורות כולם ציבוריים, והעמודים נבחרו כדי לייצג מגוון רחב של עימודים מורכבים ולא רק טקסט פשוט ורציף. התיוג נעשה ידנית באמצעות מיקור חומונים שהוכשרו לפי הנחיות מסודרות, וחלק מהעמודים תויגו פעמיים ושלוש כדי לאפשר מדידה של חוסר ודאות ורמת דיוק מרבית.

בניגוד לגרסאות קודמות שמסתמכות על פורמט COCO, המבנה כאן מותאם ישירות לעבודה עם מסמכים ומכיל גם את קובץ ה־PDF המקורי כמידע בינארי וגם את תאי הטקסט הפנימיים שלו. כל רשומה מייצגת עמוד בודד ומכילה תמונת עמוד, רשימת תיבות חוסמות, פוליגונים של סגמנטציה, שטחים ומטא-דאטה. התיוג מפרק את הדף ל־11 מחלקות מוגדרות, כולל כותרות, כותרות עמוד, הערות שוליים, פסקאות, טבלאות, תמונות, פריטי רשימה ונוסחאות מתמטיות. החלוקה הפנימית מוגדרת מראש לחלקי אימון, בדיקה ואימות כדי למנוע זליגת סגנונות עימוד ביניהם.

מתאים ל

  • זיהוי מבנה מסמכים מורכבים

    אימון מודלים לזיהוי מיקום של טבלאות, כותרות, תמונות ונוסחאות בתוך דפי PDF מרובי עמודות.

  • חילוץ מידע מדוחות כספיים

    הפרדה מדויקת בין תוכן טבלאי להערות שוליים וטקסט רץ לצורך עיבוד אוטומטי של נתונים פיננסיים.

  • הערכת ביצועי מודלי Layout

    בדיקת איכות של מודלי סגמנטציה על סטי הבדיקה הקבועים מראש מול תיוג אנושי ברמת איכות גבוהה.

איפה זה נופל

הכרטיס לא מדווח על שפות המסמכים, וכשמדובר בעברית או טקסט מימין לשמאל יש לבדוק ידנית אם קיימות דוגמאות כאלו במאגר. בנוסף, מדובר בתיוג אנושי שמבוסס על מיקור חוץ, כך שקיימת אי-ודאות בחלק מההגדרות של אלמנטים גבוליים, עובדה שהובילה לתיוג כפול בחלק קטן מהעמודים. המבנה אינו מגיע בפורמט COCO סטנדרטי של ראייה ממוחשבת, מה שדורש התאמת קוד הטעינה אם רגילים לצנרת עיבוד ישנה.

אותה משפחה

DocLayNet יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לפי כרטיס המאגר הרישיון הוא CDLA-Permissive-1.0 שמאפשר שימוש מסחרי, אך בעמוד הראשי של הריפו הרישיון מסומן כלא מוגדר. במצב כזה מומלץ לוודא את העניין מול היוצרים לפני שילוב בקוד מסחרי כדי להימנע מאי-הבנות משפטיות.

האם הדאטהסט כולל מסמכים בעברית?

התיעוד אינו מפרט את שפות המסמכים ומתרכז בקטגוריות תוכן כמו פטנטים ומאמרים. סביר להניח שהרוב המוחלט הוא באנגלית, ולכן אם המטרה היא מסמכים מקומיים בעברית יש לבצע בדיקה מקדימה על מדגם קטן.

מה ההבדל בין גרסה זו לגרסת DocLayNet המקורית?

הגרסה הזו זונחת את פורמט COCO ומכילה עמודה בינארית עם קובץ ה־PDF המקורי ורשימת תאים פנימיים מתוכו. זה חוסך את הצורך בהורדה והתאמה של קבצי המקור בנפרד לצורך מיצוי טקסט.

איך נאספו הנתונים ומי תייג אותם?

המסמכים נאספו ממקורות ציבוריים בשש קטגוריות שונות כדי ליצור גיוון עיצובי. התיוג בוצע ידנית על ידי מתייגים במיקור חוץ שעברו הכשרה לפי מדריך תיוג רשמי של צוות המחקר.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס מפורמט Parquet, המחולק ל־87 קבצים ללא צורך באישור גישה מראש. קבצי האימון בלבד מחולקים ל־72 קטעים, לצד 6 קטעי בדיקה וקטעי אימות. כל שורה מכילה אובייקט תמונה, רשימת bboxes עם קטגוריות, ומערך pdf_cells שמחזיק את התוכן הטקסטואלי הפנימי, כך שמומלץ לשלוף רק את העמודות הנחוצות ולא לטעון את כל קובצי ה־PDF הבינאריים לזיכרון בבת אחת.

from datasets import load_dataset

ds = load_dataset("docling-project/DocLayNet-v1.2")

הרישיון

במטא-דאטה של המאגר מצוין שלא דווח רישיון, אך בטקסט התיאור נכתב כי הוא מופץ תחת רישיון CDLA-Permissive-1.0 של קרן לינוקס. רישיון זה מאפשר שימוש מסחרי, שינוי ושיתוף של הנתונים, ואינו מחייב שיתוף של מודלים שאומנו עליו תחת אותו רישיון. חובה לשמור על הודעות זכויות היוצרים והייחוס לצוות המחקר של IBM.

הרישיון המלא ב־Hugging Face ↗