GPT
A

AmericanStories

קוד פתוח

dell-research-harvardcc-by-4.02023-06-12

  • social science
  • economics
  • news
  • newspaper
  • large language modeling

טקסטים מובנים של כתבות מתוך עיתונות אמריקאית היסטורית, שחולצו מכמעט עשרים מיליון סריקות. מתאים למי שרוצה לאמן מודלים על אנגלית עתיקה או לבנות חיפוש מבוסס מקורות על ההיסטוריה של ארה"ב.

  • 5,655הורדות בחודש
  • 174לייקים

מה זה

המאגר כולל טקסטים של כתבות עיתון מלאות שחולצו מקרוב לעשרים מיליון סריקות של אוסף Chronicling America בספריית הקונגרס. הנתונים מחולקים לפי שנים, בין 1774 ל־1963, כשכל שנה ארוזה בקובץ דחוס משלה. הרשומות מגיעות בשתי רמות פירוט לבחירה: רמת הכתבה הבודדת או רמת הסריקה השלמה.

ברמת הכתבה מקבלים שדות של שם העיתון, תאריך, מהדורה, עמוד, כותרת, קרדיט לכותב וגוף הטקסט המחובר מכל העמודות והתיבות. ברמת הסריקה מקבלים מחרוזת JSON גולמית שכוללת את המטא-דאטה מספריית הקונגרס, חלוקה לתיבות תוכן, קריאות OCR וסיווג מידת הקריאות של הסריקה. החילוץ נעשה באמצעות מערכת למידה עמוקה שזיהתה מבנה עמודים וחיברה קטעים שהמשיכו בין טורים, מה שמשפר את רציפות הטקסט יחסית ל־OCR פשוט מהעבר.

מתאים ל

  • אימון מקדים של מודלי שפה

    לימוד אוצר מילים, תחביר היסטורי וידע עולם על מאתיים שנות היסטוריה אמריקאית.

  • בניית מאגר אחזור ל־RAG

    חיפוש עובדות, אירועים פוליטיים ומידע גנאלוגי מתוך עיתונות ישנה עבור מערכות שאלות ותשובות.

  • זיהוי תוכן משוכפל בהיסטוריה

    מעקב אחרי הפצה של ידיעות עיתונאיות זהות בין מדינות שונות באמצעות מודלים מבוססי טרנספורמר.

  • פיתוח מודלים לניתוח מבנה מסמך

    אימון מערכות רב-מודאליות על פירוק עמודי עיתון מורכבים לתיבות טקסט.

איפה זה נופל

הטקסטים מגיעים מעיתונות מקומית לא מסוננת לאורך שתי מאות, ולכן הם כוללים הטיות גזעיות, שפה פוגענית, טעויות עובדתיות ודיווחים מוטים של עורכים מאותה תקופה. אי אפשר להתייחס לכתבות כאל תיעוד עובדתי טהור. הנתונים קיימים באנגלית בלבד, ואיכות הטקסט מוגדרת כאיכות כסף בגלל מגבלות טכנולוגיות של סריקה וזיהוי תווים היסטורי, כך שיש שגיאות פיענוח נקודתיות. לא הייתי מכניס את הטקסטים ישירות למודל מול לקוחות בלי סינון מוקדם של תכנים היסטוריים פוגעניים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי חופשי, כולל אימון מודלים סגורים. הדרישה היחידה היא מתן קרדיט ברור למחברים בהתאם לרישיון.

האם המאגר כולל טקסטים בעברית?

לא. כל הנתונים באנגלית בלבד, ומקורם בעיתונים היסטוריים שהודפסו בארצות הברית בין השנים 1774 ל־1963.

איך נאסף החומר והאם הטקסט נקי?

החומר מבוסס על סריקות של ספריית הקונגרס שעברו פענוח מחדש באמצעות מודלים לזיהוי מבנה עמוד ו־OCR. איכות הטקסט מוגדרת כאיכות כסף, כלומר היא מדויקת משמעותית מ־OCR ישן, אבל עדיין מכילה שגיאות פענוח או חיתוך.

האם כדאי להוריד את כל המאגר בבת אחת?

לא מומלץ למרבית המשתמשים. מדובר במאות קבצי ארכיון גדולים ובמאות מיליוני רשומות. עדיף להשתמש בהגדרת subset_years ולמשוך רק את טווח השנים שרלוונטי למחקר שלכם.

איך טוענים

טוענים את הנתונים דרך load_dataset עם הסקריפט AmericanStories.py, ללא צורך בהרשמה מראש או בקשת גישה. אין כאן חלוקה רגילה לרכבת ובדיקה, אלא ניגשים לכל שנה כספליט נפרד דרך ציון השנה הרצויה. מומלץ מאוד לא להוריד את כל המאגר בבת אחת כי מדובר במאות קבצי ארכיון ובטווח של מאה מיליון עד מיליארד רשומות, אלא להשתמש בקונפיגורציית subset_years ולהגדיר את רשימת השנים המדויקת שנחוצה לכם.

from datasets import load_dataset

ds = load_dataset("dell-research-harvard/AmericanStories")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבנות עליו מוצרים ולאמן מודלים, בתנאי שנותנים קרדיט מלא ליוצרים מאוניברסיטת הרווארד ושותפיהם ומציינים אם נעשו שינויים בנתונים. אין חובת שיתוף זהה, כך שאין צורך לחשוף מודלים או קוד שפותחו על בסיסו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗