GPT
C

cnn_dailymail

קוד פתוח

abiseeapache-2.02022-03-02

מעל 300 אלף כתבות חדשות באנגלית עם תקצירי נקודות שנכתבו בידי עיתונאים. הוא הפך לבנצ'מרק המרכזי לאימון והערכה של מודלי סיכום טקסט.

  • 85,552הורדות בחודש
  • 348לייקים

מה זה

המאגר כולל זוגות של כתבות מלאות ופסקאות תקציר שנאספו מארכיוני הרשת של CNN והדיילי מייל. בממוצע, כתבה מכילה 781 טוקנים, והתקציר הנלווה מורכב מחיבור נקודות השיא ומכיל 56 טוקנים. הכתבות של CNN נכתבו בין אפריל 2007 לאפריל 2015, והכתבות של הדיילי מייל נכתבו בין יוני 2010 לאפריל 2015. בגרסה הראשונה הושמטו כתבות שחצו את רף 2000 הטוקנים.

בגרסה 3.0.0, שהיא הגרסה ללא אנונימיזציה, החלוקה קבועה וכוללת 287,113 דוגמאות לאימון, 13,368 לוולידציה ו־11,490 לבדיקה. בגרסאות המוקדמות ישויות שמיות הוחלפו במזהים ייחודיים לצורכי שאלות והבנת הנקרא, ואילו בגרסאות המאוחרות הטקסט נשמר במבנה המקורי שלו עם שמות מלאים לצורך סיכום מופשט או חילוצי.

מתאים ל

  • אימון מודלי סיכום

    לימוד מודלים לייצר תקציר קצר וקולע מתוך כתבה באנגלית.

  • הערכת ביצועי ROUGE

    בדיקת איכות של מודל שפה מול בנצ'מרק סטנדרטי בתעשייה.

  • חילוץ משפטי מפתח

    אימון מערכות לסימון משפטים חשובים מתוך טקסט חדשותי ארוך.

איפה זה נופל

אם אתם בונים מוצר בעברית, אין לכם מה לחפש כאן כי כל הטקסט באנגלית בלבד. הנתונים משקפים נקודת מבט עיתונאית מארצות הברית ומבריטניה, ולא נגעו בהם מאז 2015, כך שהשפה והאירועים ישנים. מחקרים המצוטטים בכרטיס מצאו הטיות מגדריות במילים מסוימות, לצד מבנה חדשותי טיפוסי שבו רוב המידע הקריטי מרוכז בשליש הראשון של הכתבה. בבדיקה ידנית של הגרסה הראשונה, 25% מהדוגמאות התגלו כקשות להבנה או מעורפלות אפילו לבני אדם, מה שעלול לייצר רעש בלימוד.

שאלות
נפוצות

האם הדאטהסט מתאים לפיתוח מודל בעברית?

לא. כל הכתבות והתקצירים נכתבו באנגלית של ארצות הברית ובריטניה בלבד. אין במאגר טקסטים בעברית כלל.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון המדווח בכרטיס הוא Apache-2.0 שמתיר שימוש מסחרי בקוד ובנתונים של גרסה 1.0.0 תחת ייחוס מתאים. למרות זאת, גוף הטקסט מורכב מכתבות מקור של CNN והדיילי מייל, ולכן כדאי לבחון את ההשלכות המשפטיות של אימון מודל על כתבות עיתונאיות מוגנות.

מאיפה הגיעו הנתונים ואיך הם נאספו?

חוקרי DeepMind הורידו את הכתבות מארכיוני Wayback Machine של האתרים cnn.com ו־dailymail.co.uk. התקצירים נוצרו על ידי שרשור נקודות המפתח שהעיתונאים כתבו במקור בראש הכתבה.

מה ההבדל בין הגרסאות של המאגר?

גרסה 1.0.0 נבנתה במקור למשימות שאלות ותשובות והחליפה שמות של אנשים וישויות בקודים מזהים. גרסאות 2.0.0 ו־3.0.0 מותאמות למשימת סיכום, כאשר גרסה 3.0.0 כוללת את הטקסט המקורי ללא הסתרת שמות וישויות.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה בלי צורך באישור גישה או הרשמה מיוחדת. הנתונים מחולקים לקובצי parquet לפי גרסאות. כל רשומה כוללת שלושה שדות בלבד: id שמכיל גיבוב של כתובת המקור, article שכולל את גוף הכתבה, ו־highlights שמחזיק את הטקסט שאליו מכוונים את המודל בסיכום.

from datasets import load_dataset

ds = load_dataset("abisee/cnn_dailymail")

הרישיון

הכרטיס מציין רישיון Apache-2.0 עבור גרסה 1.0.0, שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. הוא לא מחייב אתכם לפתוח את הקוד שלכם באותו רישיון. עם זאת, יש לזכור שהתוכן עצמו מבוסס על כתבות עיתונאיות של גופי תקשורת מסחריים שנאספו מארכיון האינטרנט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗