GPT
N

newswire

קוד פתוח

dell-research-harvardcc-by-4.02024-06-03

  • social science
  • economics
  • news
  • newspaper
  • large language modeling

המאגר מרכז 2.7 מיליון כתבות עיתונות אמריקאיות היסטוריות בנחלת הכלל, כולל תיוגי נושאים, ישויות מוויקיפדיה ומיקום גיאוגרפי. הוא נותן כיסוי נרחב לאנגלית ולעולם העיתונות של המאה שבין 1878 ל־1977.

  • 2,703הורדות בחודש
  • 92לייקים

מה זה

הנתונים כוללים 2.7 מיליון כתבות ייחודיות מסוכנויות ידיעות אמריקאיות, שנאספו על פני מאה שלמה, מ־1878 עד 1977. החומר מחולק ל־102 קבצים, שכל אחד מהם מייצג שנה בודדת במבנה קובץ ייעודי כמו 1952_data_clean.json. הטקסטים נכתבו על ידי עורכים, בעלי טורים ומקורות חדשותיים של אותה תקופה, והם כולם נמצאים בנחלת הכלל.

כל רשומה כוללת את טקסט הכתבה המלא, כותרת משנה, שנת פרסום ורשימת תאריכים. מעבר לטקסט הגולמי, יש כאן מטא-דאטה עשיר: רשימת העיתונים שפרסמו את הידיעה עם מזהה ספריית הקונגרס, מיקומי סוכנות הידיעות כולל קואורדינטות או זירות לחימה היסטוריות, סיווגים בינאריים של נושאים כמו זכויות אזרח, עבודה ופשיעה, ורשימת אנשים שאוחדו ישירות מול מזהי ויקינתונים וויקיפדיה.

מתאים ל

  • אימון מקדים לאנגלית היסטורית

    אימון או המשך אימון של מודלי שפה על טקסט עיתונאי מ־1878 עד 1977.

  • בסיס ידע למערכות RAG

    חיבור הכתבות למאגר וקטורי לשליפת עובדות ואירועים היסטוריים בארצות הברית.

  • אימון מודלים לסיווג נושאים

    שימוש בתיוגים המוכנים של פשיעה, פוליטיקה וזכויות אזרח לאימון מסווגים.

איפה זה נופל

הטקסטים מגיעים כולם באנגלית ומציגים תמונת עולם אמריקאית של המאה הקודמת, בלי שום נגיעה לעברית או לישראל המודרנית. החוקרים עצמם מבהירים שהתוכן לא עבר סינון, ולכן הוא כולל שגיאות עובדתיות, עיוותים מכוונים של אירועים היסטוריים ותכנים פוגעניים שהיו נפוצים באותן שנים. אי אפשר להסתמך עליו כמקור עובדתי טהור, ואם אתם בונים מערכת מודרנית לשליפת מידע, המודל עלול ללמוד הטיות היסטוריות כבדות ודעות אישיות של כותבים מהמאה התשע עשרה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן. הרישיון הוא cc-by-4.0, והכתבות עצמן הן בנחלת הכלל. אתם יכולים לאמן מודלים למוצרים מסחריים, בתנאי שאתם נותנים ייחוס מתאים לחוקרים מהרווארד.

האם יש במאגר טקסטים בעברית?

לא. המאגר כולו באנגלית בלבד. הוא מכסה עיתונות אמריקאית מקומית וארצית מסוף המאה ה־19 ועד אמצע המאה ה־20.

איך המידע הזה נאסף ותויג?

הטקסטים נאספו מכתבות מקוריות של סוכנויות ידיעות בעיתונים היסטוריים. התיוג לנושאים נעשה באמצעות מודל סיווג נוירוני ייעודי, וזיהוי הדמויות הוצלב אוטומטית מול מזהי ויקינתונים וויקיפדיה.

באיזה מבנה הקבצים מגיעים?

המאגר מחולק ל־102 קובצי JSON נפרדים, שכל אחד מהם מייצג שנה אחת בין 1878 ל־1977. המבנה הזה מקל על עבודה עם שנים מסוימות בלי להוריד את כל 2.7 מיליון הרשומות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בלי שום צורך לבקש אישור גישה מראש. אפשר להוריד את כל 102 הקבצים יחד, או לבחור שנים ספציפיות על ידי הגדרת data_files בטעינה, למשל לקחת רק את 1929 או 1969. השדות המרכזיים לעבודה שוטפת הם article לטקסט הנקי, ca_topic ומשתני הנושאים הבינאריים למיון, ו־people_mentioned לחילוץ ישויות ומגדר מתוך ויקינתונים.

from datasets import load_dataset

ds = load_dataset("dell-research-harvard/newswire")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. זה אומר שמותר להשתמש בו לצרכים מחקריים ומסחריים, לעבד אותו ולאמן עליו מודלים, בלי חובה לשתף את התוצרים באותו רישיון. הדרישה היחידה היא לתת קרדיט הולם לצוות המחקר של הרווארד שפרסם אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗