GPT
E

europeana_newspapers

קוד פתוח

biglamרישיון לא דווח2022-10-04

  • newspapers
  • lam
  • OCR

המאגר כולל עיתונות היסטורית אירופית סרוקה עם כ־32 מיליארד טוקנים ב־12 שפות. הוא מיועד למי שחוקר שינויים בשפה או מאמן מודלים על טקסט ישן עם מדדי איכות OCR.

  • 576הורדות בחודש
  • 59לייקים

מה זה

הנתונים נלקחו מפרויקט Europeana Newspapers, שבו נסרקו עיתונים מהמאה ה־18 ועד תחילת המאה ה־20. יוזמת BigLAM המירה את קובצי ה־ALTO XML המקוריים לקובצי Parquet, חילצה את הטקסט לפי סדר הקריאה, ואיחדה מטא-דאטה מפוזר מקובצי XML שונים.

כל רשומה מייצגת עמוד עיתון בודד. הרשומה מכילה את הטקסט המלא, כותרת העיתון, תאריך פרסום בפורמט ISO, שפת התוכן, קישור לתמונת המקור ב־IIIF, מזהה קבוע וקואורדינטות של איורים ורכיבים חזותיים. בנוסף יש ציוני mean_ocr ו־std_ocr שמודדים את רמת הוודאות של המנוע שסרק את העמוד.

המאגר מחולק ל־96 קבצים לפי שפה ועשור, למשל קבצים ייעודיים לגרמנית משנות ה־1680 ואילך. החלוקה הזו נועדה לאפשר הורדה של תקופות ספציפיות בלי למשוך את כל המאגר בבת אחת.

מתאים ל

  • אימון מודלים היסטוריים

    אימון והתאמה של מודלי שפה להבנת ניסוחים ומבנים לשוניים מהמאות ה־18 וה־19.

  • פיתוח תיקוני OCR

    בניית מודלים לתיקון שגיאות סריקה אוטומטיות באמצעות ציוני הוודאות mean_ocr ו־std_ocr.

  • מחקר במדעי הרוח

    ניתוח השוואתי של סיקור אירועים היסטוריים ומעקב אחרי שינויי שיח ומונחים לאורך עשורים.

  • זיהוי מבנה עמוד

    אימון מודלים לניתוח פריסה חזותית בעזרת קואורדינטות האיורים שבשדה bounding_boxes.

איפה זה נופל

איכות ה־OCR משתנה מאוד בין תקופות, ועיתונים ישנים שנדפסו בגופנים שאינם סטנדרטיים כוללים שגיאות זיהוי רבות. הכיסוי הגיאוגרפי והכרונולוגי אינו אחיד, ויש פערים גדולים בייצוג בין השפות השונות. יש עמודים וגליונות שחסרים במקור. עיתונים היסטוריים מכילים הטיות ודעות קדומות של התקופה שבה נכתבו. בנוסף, עברית אינה נכללת במאגר, אם כי יש בו יידיש לצד שפות אירופיות אחרות.

שאלות
נפוצות

האם המאגר כולל עיתונים בעברית?

עברית אינה נכללת ברשימת השפות של המאגר. הרשימה כוללת 12 שפות אירופיות, ביניהן גרמנית, צרפתית, רוסית, אוקראינית ויידיש.

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון של המאגר לא דווח בכרטיס הנתונים. ללא רישיון מפורש אי אפשר לדעת אם שימוש מסחרי מותר או אילו הגבלות חלות עליו, ולכן עדיף לברר את הנושא מול BigLAM או Europeana לפני שמשלבים אותו במוצר.

איך מסננים סריקות באיכות נמוכה?

כל רשומה מכילה את השדות mean_ocr ו־std_ocr, שמייצגים את רמת הוודאות של המנוע שסרק את הדף. אפשר להגדיר סף מספרי כדי לפסול מראש עמודים עם טקסט משובש במיוחד.

איך בנויים הקבצים במאגר?

המאגר מורכב מ־96 קובצי Parquet שמחולקים לפי קוד שפה ועשור של פרסום. החלוקה הזו מאפשרת להוריד רק את השנים והשפות שרלוונטיות למחקר שלכם בלי למשוך את כל 32 מיליארד הטוקנים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון או מושכים קובצי Parquet ספציפיים לפי שפה ועשור. אין צורך באישור גישה מיוחד. המאגר מכיל בין מיליון לעשרה מיליון רשומות בהיקף של כ־32 מיליארד טוקנים, לכן הורדה מלאה תדרוש נפח אחסון משמעותי וזמן עיבוד ארוך. לפני תחילת העבודה מומלץ להסתכל על השדות mean_ocr ו־std_ocr כדי לסנן סריקות משובשות, ולהשתמש ב־bounding_boxes אם רוצים להפריד בין תמונות לטקסט.

from datasets import load_dataset

ds = load_dataset("biglam/europeana_newspapers")

הרישיון

בכרטיס המאגר מצוין שהרישיון טרם דווח. המצב הזה מציב סיכון משפטי ברור. כל עוד אין רישיון מוגדר, לא ידוע אם מותר להשתמש במידע למטרות מסחריות, מהן דרישות הייחוס, ואם חלות הגבלות על משקלי מודלים שאומנו עליו. לשימוש מסחרי מומלץ לפנות קודם ליוזמי הפרויקט או לבדוק את זכויות המקור ב־Europeana.

הרישיון המלא ב־Hugging Face ↗