GPT
T

tldr-17

קוד פתוח

webiscc-by-4.02022-03-02

  • reddit-posts-summarization

מיליוני פוסטים מרדיט עם תקצירי TL;DR שנכתבו בידי הגולשים עצמם. המאגר נותן חלופה לא רשמית וספונטנית לדאטהסטים חדשותיים יבשים לתקצור אבסטרקטי באנגלית.

  • 1,126הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל 3,848,330 רשומות שנאספו מסריקה רחבה של רדיט בין השנים 2006 ל־2016, מתוך מאגר מקורי של 286 מיליון פוסטים ו־1.6 מיליארד תגובות. החוקרים סיננו את הטקסטים בצינור עיבוד של חמישה שלבים, שכלל הסרת בוטים לפי רשימות קהילתיות ובדיקה ידנית של שמות משתמש עם המילה bot. הטקסטים מייצגים כתיבה חופשית ממגוון קהילות באתר.

כל רשומה מורכבת מגוף הפוסט המשמש כמסמך המקור באורך ממוצע של 270 מילים, לצד הסיכום שהכותב הצמיד לו באורך ממוצע של 28 מילים. השדות כוללים את תוכן ההודעה, הסיכום, שם המשתמש, מזהה הפוסט ושם התת-פורום. אין כאן חלוקה מובנית לערכות אימון, בדיקה ואימות, וכל הנתונים מגיעים במקשה אחת תחת train בלבד.

מתאים ל

  • אימון מודלי תקצור

    לימוד מודלים הפקת תקציר תמציתי מתוך שפת דיבור יומיומית ולא רשמית.

  • הערכת תקצור אבסטרקטי

    בדיקת ביצועי מודל מול סיכומי אנוש קצרים באמצעות מדדי ROUGE.

  • ניתוח כוונות כתיבה ברשת

    סיווג פוסטים לפי אופי התקציר, בין אם מדובר בסיכום עובדתי ובין אם בבדיחה.

איפה זה נופל

הנתונים נאספו עד שנת 2016, כך שהסלנג וההקשרים התרבותיים ישנים בכמעט עשור. המאגר כולו באנגלית בלבד, ואין בו ייצוג לשפות אחרות. מעבר לכך, גולשים כותבים TL;DR ממניעים שונים מאוד. חלקם אכן מסכמים את העלילה, אך אחרים משתמשים בזה לבדיחה, פאנץ' ליין, בקשת עזרה או הבעת דעה שלא מתמצתת את גוף הטקסט. התיעוד מציין במפורש שעל אף הסינון, המאגר עשוי להכיל שפה פוגענית, עובדה שדורשת בדיקת רעילות קפדנית לפני שילוב במוצר.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. המאגר כולל אך ורק פוסטים שנכתבו באנגלית ברדיט. אין בו שום תוכן בעברית או תמיכה בריבוי שפות.

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

הרישיון המוצהר בריפו הוא cc-by-4.0, שמתיר שימוש מסחרי בכפוף למתן קרדיט. עם זאת, המידע מבוסס על תוכן גולשים מרדיט, ולכן כדאי לבדוק את תנאי השימוש של הפלטפורמה המקורית לפני הפצה מסחרית.

כמה מקום בדיסק צריך להכין כדי לעבוד איתו?

קובץ ההורדה הראשוני תופס 3.14 גיגה-בייט. לאחר פריסה והפקה של הנתונים המאגר תופס 18.94 גיגה-בייט, ובסך הכל נדרשים לפחות 22.08 גיגה-בייט פנויים.

האם יש חלוקה מובנית לטסט וטריין?

לא, כל 3,848,330 הרשומות נמצאות בחלק אחד שמסומן כ־train. מי שמשתמש במאגר צריך לבצע פיצול עצמאי לסט בדיקה ואימות לפי צרכי הפרויקט.

איך טוענים

טעינת המאגר מתבצעת ישירות דרך הספרייה הרגילה באמצעות webis/tldr-17, ללא צורך באישור גישה מוקדם או בהרשמה. קובץ ההורדה הדחוס שוקל 3.14 גיגה-בייט, אך החילוץ והבנייה שלו בפורמט המקומי דורשים 18.94 גיגה-בייט ומנצלים סך הכל 22.08 גיגה-בייט בדיסק. השדות העיקריים לעבודה הם content כמקור ו־summary כמטרה. בגלל היעדר פיצול מובנה, חובה להגדיר חלוקה ידנית ל־test ול־validation לפני שמתחילים לאמן.

from datasets import load_dataset

ds = load_dataset("webis/tldr-17")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, מחקרי ושינוי של הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים וללא חובת שיתוף תחת אותו רישיון. עם זאת, הטקסטים עצמם נאספו מרדיט ונוצרו בידי משתמשי האתר, סוגיה משפטית שמחייבת זהירות עצמאית בעת אימון מודלים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗