GPT
R

REDDIT_comments

קוד פתוח

HuggingFaceGECLM2023-03-15

  • reddit
  • social-media

מאגר ענק של תגובות מרדיט שנאספו מתוך 50 קהילות נבחרות, עם מטא-דאטה מפורט שמתאים לאימון מודלי שיחה ומודלי שפה באנגלית.

  • 7,039הורדות בחודש
  • 22לייקים

מה זה

המאגר כולל עשרות מיליארדי תגובות שנשלפו מתוך מאגרי Pushshift של רדיט, בין השנים 2006 לינואר 2023. הנתונים מחולקים ל־50 חלקים שונים, כשכל חלק מייצג סאברדיט מסוים שנחשב איכותי יחסית, למשל AskHistorians, programming, explainlikeimfive, או changemyview.

כל רשומה היא תגובה בודדת. המפרסמים צמצמו את המידע לרשימת שדות קבועה והמירו את כל הערכים לטקסט, מכיוון שהפורמט של Pushshift השתנה לאורך השנים. השדות כוללים את תוכן התגובה עצמו, מזהה התגובה וההורה שלה לצורך שחזור שרשורים, שם המשתמש, תאריך הפרסום, הניקוד, ואינדיקציות כמו controversiality או מספר הפרסים שהתגובה קיבלה.

מתאים ל

  • אימון מודלי שיחה באנגלית

    חיבור תגובות לתגובות אב לפי מזהי ההורה מאפשר לבנות עצי שיחה מורכבים במגוון סגנונות כתיבה.

  • אימון מודלי שפה לתחום ספציפי

    אפשר לקחת חלקים ממוקדים כמו קהילת התכנות או ההיסטוריה כדי לחזק ידע בתחום מקצועי מסוים.

  • מחקר על דפוסי שיח ורעילות

    ניתוח התפלגות של מדדי מחלוקת, פרסים וציוני משתמשים בדיונים ציבוריים לאורך כמעט שני עשורים.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אין כאן מילה אחת בעברית. המפרסמים מציינים מפורשות שהנתונים מייצגים חתך דמוגרפי מוטה מאוד, בעיקר גברים צעירים מארצות הברית, ושעדיין קיימים בו ביטויים פוגעניים ורעילות למרות הסינון של הקהילות. המאגר מכיל שמות משתמש מלאים וישנים של אנשים אמיתיים, והמפרסמים עצמם דורשים לבצע אנונימיזציה לפני שמעבדים אותו. אם אתם בונים מוצר הפונה לקהל ישראלי או רחב, תצטרכו סינון כבד של רעילות ופרטיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון לא צוין בכרטיס הדאטהסט, והטקסטים שייכים לגולשי רדיט שנאספו דרך פרויקט צד שלישי. אימון מודל מסחרי על נתונים אלו מלווה בסיכון משפטי ואינו מומלץ ללא בדיקה יסודית.

האם המאגר כולל תוכן בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הקהילות שנאספו הן קהילות בינלאומיות שכותבות באנגלית.

איך הנתונים נאספו והוכנו?

הנתונים נשלפו מתוך מאגרי המידע הציבוריים של Pushshift שסרקו את רדיט מ־2006 עד ינואר 2023. היוצרים סיננו 50 קהילות שנחשבות איכותיות, שמרו רשימת עמודות מצומצמת והמירו את כל הערכים למחרוזות.

איך טוענים

הנתונים מחולקים ל־537 קבצי Parquet לפי קהילות. בגלל שמדובר בעשרות מיליארדי רשומות, לא מורידים את הכל בבת אחת אלא טוענים רק את הסאברדיטים שרלוונטיים לפרויקט שלכם, או מזרימים את המידע ישירות. אין צורך באישור גישה מיוחד למאגר. שימו לב שכל השדות שמורים כמחרוזות טקסט, כך שאם אתם בונים סינון לפי ציונים או תאריכים, תצטרכו להמיר אותם ידנית למספרים בקוד.

from datasets import load_dataset

ds = load_dataset("HuggingFaceGECLM/REDDIT_comments")

הרישיון

למאגר לא הוזן רישיון רשמי בעמוד. בנוסף, המידע מבוסס על סריקות של Pushshift מרדיט ומכיל תוכן גולשים ושמות משתמש. שימוש מסחרי במצב כזה הוא סיכון משפטי ברור, וכל אימון של מודל לשימוש חיצוני או מסחרי דורש בדיקה משפטית מול תנאי השימוש של רדיט.

הרישיון המלא ב־Hugging Face ↗