GPT
U

US-PD-Newspapers

קוד פתוח

PleIAscc0-1.02024-02-06

  • ocr

מאגר ענק של עיתונות היסטורית מארצות הברית ברשות הציבור, ללא זכויות יוצרים. הוא מציע גישה חופשית לגמרי לטקסט מלא של מאות שנות דפוס לאימון מודלים או מחקר.

  • 5,703הורדות בחודש
  • 49לייקים

מה זה

הנתונים מגיעים ישירות מסריקות הארכיון הדיגיטלי Chronicling America של ספריית הקונגרס האמריקאית, ונאספו על ידי פייר קרל לנגלה. המאגר מכיל כמעט 21 מיליון גליונות עיתונים וכתבי עת שפורסמו בין השנים 1690 ל־1963, עם היקף כולל של כמעט 100 מיליארד מילים. כל קובץ פרקט תואם לאחד מתוך 2,618 קובצי המקור ששחררה הספרייה, ומכיל טקסט מלא של כמה אלפי פריטים שנבחרו באקראי יחד עם מטא דאטה בסיסי כמו מזהה מהדורה, תאריך וספירת מילים.

רוב הטקסט כתוב באנגלית, אבל יש בו גם ייצוג לשפות אירופיות נוספות, כולל כ־600 אלף מהדורות בגרמנית ו־400 אלף מהדורות בספרדית. אין כאן סינון איכות מתקדם או ניקוי ידני, והטקסט משקף את קובצי ה־OCR הגולמיים כפי שנוצרו במקור.

מתאים ל

  • אימון מקדים של מודלי שפה

    שימוש בטקסט גולמי רחב היקף לאימון מודלים פתוחים ללא חשש מתביעות זכויות יוצרים.

  • מחקר כמותי במדעי הרוח

    ניתוח מגמות היסטוריות, מעקב אחר ביטויים ותפוצת טקסטים בעיתונות לאורך שלוש מאות שנה.

  • בדיקת שיטות לתיקון OCR

    בסיס נתונים לפיתוח והערכה של אלגוריתמים שמנקים שגיאות זיהוי תווים בטקסטים היסטוריים.

איפה זה נופל

איכות הטקסט היא בעיה מרכזית. כל החומר עבר תוכנות זיהוי תווים אופטי ישנות החל מאמצע שנות האלפיים, כך שיש בו שגיאות קריאה ממוחשבות רבות. אין חלוקה מדויקת למאמרים נפרדים, ומבנים מורכבים כמו טבלאות, מספור עמודים, כותרות עליונות וחלוקה לטורים נכנסו לטקסט בצורה משובשת. בנוסף, החומר מסתיים ב־1963 ומוטה לחלוטין לשפה ולמציאות ההיסטורית של צפון אמריקה. למי שמחפש גרסה נקייה יותר, קיים מאגר חלופי בשם American Stories שמחזיק כ־20% מהחומר אך עם OCR משופר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן. הרישיון המוגדר הוא רישיון נחלת הכלל cc0-1.0, והחומרים אינם מוגנים בזכויות יוצרים בארצות הברית. אתם יכולים לאמן מודלים מסחריים ולהפיץ אותם ללא מגבלות רישוי או דרישת שיתוף זהה.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר לשפה האנגלית, וכולל בנוסף בעיקר גרמנית עם כ־600 אלף מהדורות וספרדית עם כ־400 אלף מהדורות. אין בו חומרים בעברית.

איך המידע נאסף וסודר?

החוקר פייר קרל לנגלה אסף את קובצי ה־OCR הגולמיים של ספריית הקונגרס מפרויקט Chronicling America. הוא חילק אותם ל־2,618 קובצי parquet, כאשר כל קובץ משמר את שם הקובץ המקורי של הארכיון ומכיל טקסט מלא ומטא דאטה בסיסי.

מה ההבדל בין מאגר זה לבין American Stories?

המאגר הנוכחי מכיל כמעט 100 מיליארד מילים כפי שנסרקו במקור, ללא סינון או ניקוי. לעומתו, American Stories מחזיק רק כ־20% מהחומר, אבל כולל זיהוי תווים משופר, חלוקה ברמת כתבה ותיעוד עדיף.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face, ללא צורך בהרשמה או בבקשת אישור גישה. המאגר מורכב מ־2,659 קבצים, שרובם המוחלט הם קובצי parquet, כאשר כל קובץ מכיל טקסט מלא ומטא דאטה הכולל מזהה, תאריך וספירת מילים. בגלל ההיקף העצום של 98,742,987,471 מילים, מומלץ לעבוד בהזרמה או להוריד רק קבצים ספציפיים לפי שמות הקבצים והקודים של ספריית הקונגרס במקום למשוך את הכל בבת אחת.

from datasets import load_dataset

ds = load_dataset("PleIAs/US-PD-Newspapers")

הרישיון

המאגר מסומן ברישיון cc0-1.0 וכל החומרים בו שייכים לרשות הציבור לפי דיני זכויות היוצרים של ארצות הברית ואמנת ברן. מותר להשתמש בטקסטים לכל מטרה, כולל אימון מודלים מסחריים והפצה מחדש של הנתונים, ללא דרישת ייחוס וללא חובת שיתוף באותו רישיון. ספריית הקונגרס עצמה מציינת שאינה מחזיקה בזכויות, אך האחריות לוודא שאין הגבלות חלה על המשתמש.

הרישיון המלא ב־Hugging Face ↗