GPT
C

ccdv/cnn_dailymail

קוד פתוח

ccdvapache-2.02022-03-02

  • conditional-text-generation

מעל 300 אלף כתבות חדשות באנגלית מלוות בתקצירי נקודות מקוריים שנכתבו על ידי עיתונאים. זהו מאגר ותיק שמשמש מדד מקובל לאימון והערכה של מודלי סיכום טקסט.

  • 30,406הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל כתבות מלאות משני גופי חדשות, CNN והדיילי מייל, כשלכל כתבה מוצמד תקציר המורכב ממשפטי הנקודות הבולטות שחיברו הכתבים עצמם. הכתבות של CNN פורסמו בין אפריל 2007 לאפריל 2015, ואילו הכתבות מהדיילי מייל נאספו מיוני 2010 עד אפריל 2015 דרך ארכיון האינטרנט. בממוצע, גוף כתבה מחזיק כ־781 טוקנים, והתקציר הנלווה מגיע לכ־56 טוקנים. פריטים שחרגו מ־2000 טוקנים בסבב האיסוף המקורי נחתכו החוצה.

המבנה הפנימי מחולק לשלושה חלקים מוכנים מראש. חלק האימון מרכז 287,113 רשומות, חלק הוולידציה כולל 13,368 רשומות, וקבוצת הבדיקה מכילה 11,490 רשומות. כל רשומה כוללת שלושה שדות בלבד: מזהה ייחודי שהוא גיבוב של כתובת המקור, הטקסט המלא של הכתבה, ומחרוזת התקציר.

מתאים ל

  • אימון מודלי סיכום מופשט

    לימוד מודל שפה לייצר פסקת תמצית מקורית מתוך גוף כתבה ארוך באנגלית.

  • אימון מודלי סיכום חילוצי

    זיהוי ובחירת המשפטים החשובים ביותר מתוך הטקסט לצורך הרכבת תקציר.

  • השוואת ביצועים מול ספרות

    מדידת ציוני ROUGE על קבוצת הבדיקה כדי להשוות ביצועים מול מודלים קיימים.

איפה זה נופל

הטקסטים נכתבו באנגלית אמריקאית ובריטית בלבד, ואין כאן ייצוג לעברית או לשפות אחרות. מעבר לכך, התוכן נעצר באפריל 2015, כך שהעולם המשתקף בו ישן ואינו מכיל אירועים מודרניים. מבחינת מבנה, עיתונאים נוטים לרכז את עיקר המידע בשליש הראשון של הכתבה, הרגל שמלמד מודלים להתעלם מסוף הטקסט. הגרסה הזו אינה כוללת אנונימיזציה ומכילה שמות אנשים אמיתיים, וניתוח ידני של גרסאות קודמות גילה ערפול ושגיאות ייחוס ברבע מהדגימות, לצד הטיות מגדר מובנות בכתיבה החדשותית.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מכיל אך ורק כתבות באנגלית שנאספו מכלי תקשורת בארצות הברית ובבריטניה, בניבים en-US ו־en-GB. הוא אינו מתאים לפיתוח מודלים בעברית ללא תרגום מקדים.

האם מותר להשתמש במאגר לפרויקט מסחרי?

הקוד והמבנה מתועדים תחת רישיון apache-2.0, שמאפשר שימוש מסחרי ושילוב במודלים קנייניים. לצד זאת, הטקסטים עצמם מוגנים בזכויות יוצרים של CNN והדיילי מייל, נקודה שמפתחים מסחריים חייבים לקחת בחשבון מבחינה משפטית.

איך נאספו הנתונים במקור?

החוקרים הורידו כתבות מארכיון האינטרנט של אתרי cnn.com ו־dailymail.co.uk בין השנים 2007 ל־2015. התקצירים מבוססים על רשימות הנקודות שהכתבים ניסחו בעצמם בראש הכתבות המקוריות.

למה להשתמש בגרסה של ccdv במקום במאגר המקורי?

הגרסה הזו הועלתה במטרה לפתור תקלת הרצה ספציפית, NotADirectoryError, שהופיעה בטעינת המאגר הרשמי. התוכן, החלוקה לשלושת החלקים ומספר הרשומות זהים לחלוטין למקור.

איך טוענים

טוענים את המאגר ישירות בספריית datasets על ידי ציון המזהה ccdv/cnn_dailymail. הגרסה הזו היא העתק שנועד לעקוף שגיאת תיקיות במאגר המקורי, והיא פתוחה להורדה מיידית ללא צורך בהרשמה מוקדמת או אישור גישה. החבילה מושכת קובצי ארכיון דחוסים המכילים את הכתבות ומעובדת באמצעות סקריפט פייתון מקומי, כאשר שני השדות המרכזיים לעבודה הם article עבור הקלט ו־highlights עבור תווית היעד.

from datasets import load_dataset

ds = load_dataset("ccdv/cnn_dailymail")

הרישיון

הכרטיס מציין רישיון apache-2.0 עבור גרסה 1.0.0 של המאגר. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים ללא דרישה להפיץ את התוצרים באותו רישיון. נדרש לשמור על הודעות זכויות היוצרים והייחוס המקוריות. עם זאת, טקסט הכתבות עצמו שייך לגופי התקשורת שפרסמו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗