GPT
O

OmniDocBench

קוד פתוח

opendatalabרישיון לא דווח2024-12-02

המאגר מרכז 1,651 עמודי מסמכים סרוקים ומגוונים עם תיוג צפוף להערכת מודלי פענוח מסמכים. הוא מתאים למי שבוחן זיהוי מבנה, קריאת נוסחאות בלאטך וחילוץ טבלאות מורכבות.

  • 25,866הורדות בחודש
  • 102לייקים

מה זה

הנתונים כוללים 1,651 עמודי PDF מעשרה סוגי מסמכים שונים, החל ממאמרים אקדמיים, דוחות פיננסיים ועיתונים, ועד ספרי לימוד, שקפי מצגות, מסמכים היסטוריים ופתקים בכתב יד. הדפים מייצגים חמישה סוגי פריסה וחמש שפות שונות, כאשר ישנה חלוקה מפורטת של טקסטים וטבלאות בין אנגלית לסינית.

התיוג מכסה 28 קטגוריות ברמת הבלוק כמו פסקאות, כותרות ונוסחאות, ועוד 4 קטגוריות ברמת השורה. לכל אזור מוצמד תמלול טקסט, נוסחאות מתועדות בקוד LaTeX, וטבלאות מקודדות הן בפורמט HTML והן בפורמט LaTeX לצד הגדרות סדר קריאה ותכונות עיצוב כמו גבולות ומיזוג תאים. תהליך ההרכבה כלל סינון ידני של מסמכים מרשתות ציבוריות ותרומות משתמשים, תיוג אוטומטי המשולב בתיוג ידני, ובקרת איכות של מומחים לצד מודלי שפה.

מתאים ל

  • הערכת זיהוי מבנה עמוד

    בדיקת הדיוק של מודלים בחלוקת עמוד ל־28 קטגוריות שונות וקביעת סדר קריאה נכון.

  • מבחן חילוץ טבלאות

    מדידת ביצועי המרה של טבלאות מורכבות וממוזגות לקוד HTML ו־LaTeX.

  • קריאת נוסחאות מתמטיות

    הערכת תרגום נוסחאות מודפסות ונוסחאות בכתב יד ישירות לפורמט LaTeX תקין.

איפה זה נופל

המאגר מיועד לבדיקה ולהערכה בלבד, ולא לאימון מודלים מקיף בהיקף רחב בגלל גודלו המצומצם של 1,651 עמודים. רוב התוכן נוטה באופן מובהק לאנגלית ולסינית פשוטה, כך שאין כאן מענה לשפות הנכתבות מימין לשמאל כמו עברית. בנוסף, למרות העלאת הרזולוציה של חלק מהעיתונים והפתקים ל־200 DPI, איכות הסריקה במסמכים היסטוריים או בכתב יד עדיין יוצרת אתגרים שאינם משקפים מסמכים דיגיטליים מודרניים נקיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא, המאגר מוגדר מפורשות למטרות מחקר בלבד ולא לשימוש מסחרי. בנוסף לא דווח רישיון קוד פתוח מוכר, ולכן כל שימוש בו במוצר מסחרי כרוך בסיכון משפטי של הפרת זכויות יוצרים.

האם יש בדאטהסט תמיכה במסמכים בעברית?

לא, המאגר כולל חמש שפות אך מתמקד באופן מוחלט באנגלית ובסינית מפושטת. מסמכים בעברית לא נכללו באיסוף, ואין בו ייצוג לשפות הנכתבות מימין לשמאל.

איך נאספו וסוננו הנתונים?

הקבצים לוקטו מערוצים פתוחים ברשת ומתרומות משתמשים, תוך הסרת תכנים האסורים בהפצה. לאחר מכן עברו תיוג ידני חלקי, תיוג בעזרת מודלים, ובקרת איכות על ידי מומחים ומודלי שפה גדולים.

מה ההבדל בין מאגר זה למאגרי OCR רגילים?

בניגוד למאגרי טקסט פשוטים, המאגר הזה מתמקד במבנה עמוד מלא ומורכב. הוא מכיל תיוגי עומק הכוללים נוסחאות מתמטיות בלאטך, טבלאות עם תאים ממוזגים ב־HTML, ומיפוי מדויק של סדר הקריאה.

איך טוענים

המאגר פתוח לציבור ללא צורך באישור גישה מראש. כלל התיוגים מרוכזים בקובץ JSON יחיד בשם OmniDocBench.json, והעמודים עצמם שמורים כתמונות PNG בתיקיית images, בסך הכל 1,662 קבצים במאגר. אם אתם בוחנים מודלים שמקבלים רק קובצי PDF, המפתחים מספקים סקריפט המרה ייעודי מפייתון להפיכת התמונות בחזרה למסמכי מקור. השדות המרכזיים בקובץ כוללים תיחום אזורים, תמלול OCR נקי, ייצוג טבלאות בפורמט HTML או LaTeX, וסדר הקריאה התקין של העמוד.

from datasets import load_dataset

ds = load_dataset("opendatalab/OmniDocBench")

הרישיון

לא דווח רישיון רשמי במאגר. בהצהרת זכויות היוצרים מצוין במפורש כי החומרים נאספו ממקורות ציבוריים ונועדו אך ורק למחקר ולא לשימוש מסחרי. בשל העדר רישיון מסחרי והאיסור המפורש של היוצרים, מודל שיאומן עליו עשוי להיתקל בבעיה משפטית בהפצה מסחרית.

הרישיון המלא ב־Hugging Face ↗