GPT
I

idl-wds

קוד פתוח

pixparseother2023-12-14

המאגר מרכז מעל 19 מיליון עמודי מסמכים סרוקים מארכיון התעשייה של UCSF עם זיהוי תווים מלא. הוא נותן בסיס ענק לאימון מודלים של ראייה ושפה על מסמכים אמיתיים, מבולגנים ומרובי עמודות.

  • 5,036הורדות בחודש
  • 195לייקים

מה זה

הנתונים מגיעים מארכיון Industry Documents Library באוניברסיטת קליפורניה בסן פרנסיסקו. המאגר כולל 3,144,726 דגימות שמכילות יחד 19,174,595 עמודים. כל רשומה מייצגת מסמך שלם, מבא עמוד אחד ועד 3,000 עמודים, ומאגדת קובץ PDF, תמונת TIFF מקבילה, קובץ ocr ישן וקובץ JSON עם פענוח Textract של אמזון. הסינון שמר רק דגימות תקינות שעברו קידוד ופענוח מחדש בהצלחה.

הצוות שילב את המידע הגולמי עם פרויקט idl_data וחישב סדר קריאה משוער של טקסט לפי היוריסטיקה שסופרת התפלגות קואורדינטות בציר האופקי כדי לזהות טורים. בקובץ הנתונים מקבלים שורות מסודרות, פוליגונים, תיבות חוסמות עם קואורדינטות יחסיות, וציוני ביטחון לכל שורה. מי שמעדיף לבנות לוגיקה משלו יכול לגשת למילים ולתיבות הגולמיות שנשמרו בנפרד.

כל החומר מרוכז בפיצול יחיד של train, שמחולק ל־3,000 קובצי tar במבנה של WebDataset, יחד עם קובצי מטא דאטה שמפרטים את מספר העמודים והדגימות בכל מקטע.

מתאים ל

  • אימון מודלי ראיית מסמך

    אימון מודלים לזיהוי טקסט, חילוץ ישויות והבנת פריסה גיאומטרית של עמודים סרוקים.

  • ניתוח מסמכים מרובי טורים

    בדיקת אלגוריתמים לקביעת סדר קריאה נכון של טקסט בפורמטים מורכבים ועמוסים.

  • מחקר על דוקומנטים משפטיים

    ניתוח היסטורי ומשפטי על מסמכי תאגידים מתוך מיליוני דפים של ארכיון UCSF.

איפה זה נופל

סדר הקריאה מבוסס על היוריסטיקה פשוטה של מיקומי עמודות ולא על מודל מבנה עמוק, והאוצרים עצמם מודים שנשארו בו אי דיוקים. חוץ מזה, מקור הנתונים הוא ארכיון UCSF שמכיל בעיקר מסמכים משפטיים, פנימיים ורפואיים באנגלית של תאגידים אמריקאים. אין כאן עברית או מסמכים ישראליים, והמבנה ההיסטורי של הטפסים לא בהכרח משקף חומרים מודרניים. נוסף לכך, תוויות הטקסט מגיעות מ־OCR של Textract ולא מהקלדה ידנית מושלמת, כך ששגיאות זיהוי קיימות בתוך נתוני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הדאטהסט מוגדר תחת רישיון מותאם שנסמך על שימוש הוגן לפי הדין האמריקאי, וזכויות היוצרים על התוכן שייכות לגופים שיצרו אותו במקור. הארכיון מעמיד את החומרים לצורכי מחקר והוראה, ומשתמשים מסחריים נושאים באחריות מלאה להפרת זכויות אם ישכפלו חלקים מהותיים.

האם יש במאגר טקסטים בעברית?

לא. המסמכים נאספו מארכיוני תעשייה ותביעות בארצות הברית, והשפה השלטת היא אנגלית בלבד. אם המטרה היא אימון על מסמכים מקומיים או זיהוי עברית, המאגר הזה לא ייתן מענה.

איך נאסף הטקסט והאם הוא מדויק?

הטקסט לא הוקלד ידנית. הוא מורכב משילוב של קובצי OCR מקוריים ישנים יחד עם סריקה חדשה של AWS Textract שבוצעה במסגרת פרויקט idl_data, כולל ציוני ביטחון וקואורדינטות לכל שורה.

מה שונה בגרסה הזו לעומת המאגר הגולמי ב־UCSF?

הגרסה הזו עברה סינון והמרה ל־3,000 קובצי WebDataset מוכנים לאימון רשתות. בנוסף, האוצרים חישבו סדר קריאה משוער עבור מסמכים בעלי מספר עמודות על ידי זיהוי היוריסטי של נקודות פתיחת השורות.

איך טוענים

טוענים את המאגר באמצעות ספריית datasets של Hugging Face עם מצב הזרמה, בעזרת ספריית chug הייעודית, או דרך webdataset. אין צורך באישור גישה מיוחד, אבל מדובר ביותר משלושה מיליון מסמכים ומיליוני עמודים, כך שהורדה מלאה דורשת שימוש ב־huggingface_hub עם hf_transfer והרבה מקום אחסון פנוי. השדות המרכזיים בכל רשומה הם pdf, תמונת tif, וקובץ json שמכיל את הטקסט, תיבות התיחום וציוני הוודאות.

from datasets import load_dataset

ds = load_dataset("pixparse/idl-wds")

הרישיון

הרישיון מסומן כ־other ומתבסס על תנאי השימוש של ארכיון UCSF וחוקי זכויות יוצרים בארצות הברית. כל המסמכים מוגדרים כיום ציבוריים ולא חסויים, אבל זכויות היוצרים המקוריות עדיין שייכות לחברות או לאנשים שיצרו אותם. השימוש מותר בעיקר למחקר, ביקורת והוראה תחת דוקטרינת שימוש הוגן. אסור לשכפל את החומרים באופן מהותי, ומי שרוצה לאמן מודל למוצר מסחרי לוקח על עצמו סיכון משפטי ונדרש לפטור את האוניברסיטה מאחריות.

הרישיון המלא ב־Hugging Face ↗