GPT
P

pdfa-eng-wds

קוד פתוח

pixparseother2024-01-17

מעל שני מיליון מסמכי PDF באנגלית שעברו סינון קפדני וחילוץ מיקומי מילים, שורות ותמונות. המטרה כאן היא אימון מודלים מולטימודליים לקריאת מסמכים בלי שתצטרכו לפרק ולנקות מיליוני קבצים בעצמכם.

  • 7,737הורדות בחודש
  • 161לייקים

מה זה

המאגר מכיל 2,159,432 דוגמאות בפיצול יחיד של אימון, הכוללות כ־18 מיליון עמודים וכ־9.7 מיליארד טוקנים. הנתונים נלקחו מקורפוס SafeDocs המקורי, שמבוסס על סריקת CC-MAIN-2021-31-PDF-UNTRUNCATED של Common Crawl בנפח התחלתי של כ־11TB בקבצי זיפ. כל רשומה כוללת את קובץ ה־PDF המקורי לצד קובץ JSON מפורט שמכיל קואורדינטות של תיבות תוחמות ברמת המילה, השורה והתמונה, וכן זמני רינדור ומדדי גודל.

תהליך הסינון נועד לחסוך עבודה כבדה באימון מודלי ראייה-שפה. היוצרים השמיטו קבצים ששוקלים מעל 100MB או שלוקח להם יותר מ־500 מילי-שניות להתרנדר, בדקו תקינות פתיחה של כל קובץ כדי להעיף מידע פגום, והפעילו את papluca/xlm-roberta-base-language-detection על 512 המילים הראשונות של העמוד הראשון כדי לסנן מסמכים שאינם באנגלית. סדר הקריאה בשורות שוחזר בעזרת היוריסטיקה שמזהה עמודות לפי ריכוז נקודות ה־X של תחילת מילים משמאל.

מתאים ל

  • אימון מודלי OCR מתקדמים

    לימוד קריאת טקסט ומיקומי שורות במסמכים סרוקים ומורכבים ישירות מפיקסלים.

  • אימון Vision-Language

    קדם-אימון רחב היקף למודלים שצריכים להבין מבנה עמוד, כותרות ותמונות במסמך.

  • חילוץ מבנה וקריאת עמודות

    פיתוח מודלים להבנת סדר קריאה נכון במסמכים מרובי טורים ודוחות.

איפה זה נופל

ההסתמכות היא אך ורק על טקסט דיגיטלי פנימי שנשלף מהקובץ. טקסט שמופיע כחלק מתמונה סרוקה או כציור ביטמאפ פשוט לא קיים באנוטציות. מעבר לזה, סינון השפה בוצע לפי העמוד הראשון בלבד, כך שמסמכים רב-לשוניים או שגיאות סיווג עדיין חודרים פנימה, ועברית בוודאי לא תמצאו פה מעבר לרעש מקרי. היוריסטיקת העמודות עלולה לקרוס במסמכים מורכבים במיוחד, והיוצרים מציינים בעצמם שבעיות קידוד קלאסיות של קובצי PDF כמו ג'יבריש הוסתרו ולא נפתרו באופן יסודי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מוגדר כ־other וכפוף לתנאי Common Crawl ו־Digital Corpora, מכיוון שהקבצים נאספו מכל רחבי הרשת. אין כאן היתר מסחרי מפורש וגורף, ולכן אימון מוצר מסחרי דורש בחינה משפטית של הסיכון מול תנאי המקור.

כמה שוקל המאגר וכמה זמן לוקח להוריד אותו?

המאגר שוקל כ־1.5TB ומחולק ל־1,800 קובצי tar בפורמט webdataset. בהורדה רגילה עם כלי huggingface_hub ו־hf_transfer, התהליך לוקח כארבע שעות, בהנחה שיש לכם מספיק שטח אחסון ורוחב פס מתאים.

האם יש תמיכה במסמכים בעברית?

לא. הדאטהסט סונן במכוון לאנגלית בלבד באמצעות מודל XLM-Roberta על 512 המילים הראשונות של כל מסמך. אם אתם מחפשים קורפוס בעברית, המאגר הזה לא רלוונטי עבורכם.

איך נאסף המידע ואיך חילצו את המיקומים?

הבסיס הוא קורפוס SafeDocs שנאסף מסריקת Common Crawl של אוגוסט 2021. היוצרים שלפו את המילים, השורות והתמונות שמוטמעות דיגיטלית ב־PDF, וחישבו היוריסטיקה לזיהוי עמודות לפי תדירות קואורדינטת ה־X של תחילת המילים.

איך טוענים

הנתונים ארוזים בפורמט webdataset בתוך 1,800 קובצי tar, וסך הכל שוקלים כ־1.5TB. אפשר להזרים ישירות עם ספריית datasets או לטעון עם ספריית chug הייעודית, אבל הורדה מקומית מלאה תיקח בערך 4 שעות באמצעות כלי huggingface_hub עם hf_transfer פעיל. ברשומה תמצאו את הקובץ הבינארי תחת מפתח pdf ואת המטא-דאטה תחת json, שבו שמורים השדות pages, words, bbox, וכן images_bbox_no_text_overlap.

from datasets import load_dataset

ds = load_dataset("pixparse/pdfa-eng-wds")

הרישיון

הרישיון מוגדר כ־other ומפנה למעשה לתנאי השימוש של Common Crawl ושל Digital Corpora. החומר נאסף מאתרים ציבוריים ברשת ללא סינון זכויות יוצרים מסחרי פרטני. אם המטרה שלכם היא מחקר או אימון פנימי זה כנראה יעבור, אבל שילוב ישיר של הנתונים במוצר מסחרי ידרוש בדיקה משפטית זהירה מול תנאי הפלטפורמות המקוריות.

הרישיון המלא ב־Hugging Face ↗