GPT
E

eli5

קוד פתוח

defunct-datasetsunknown2022-03-02

שאלות ותשובות מורכבות מרדיט שמיועדות לאימון מודלים להסבר עובדתי בגובה העיניים. המאגר נסגר להורדה ישירה בעקבות שינויי הגישה לממשק של רדיט.

  • 30,875הורדות בחודש
  • 52לייקים

מה זה

הנתונים כוללים שאלות ותשובות שנאספו משלושה פורומים ברדיט: r/explainlikeimfive לנושאים כלליים, r/askscience למדע, ו־r/AskHistorians להיסטוריה. כל רשומה כוללת מזהה שאלה, כותרת, טקסט הרחבה אם נכתב, ואת התשובות שפורסמו בדיון לצד הניקוד שהמשתמשים נתנו להן. כתובות אתרים ששובצו בטקסט הוחלפו בתוויות ייעודיות ונשמרו ברשימה נפרדת.

המקור מבוסס על מאגרי Pushshift בין אוגוסט 2012 לאוגוסט 2019. החוקרים סיננו החוצה שאלות ותשובות עם ניקוד נמוך משתיים, חילקו את הנתונים לאימון, בדיקה ואימות בכל אחד משלושת התחומים, והשתמשו בהשוואת טקסט כדי למנוע כפילויות של שאלות בין חלקי החלוקה.

מתאים ל

  • אימון מענה על שאלות פתוחות

    יצירת מודלים שמסוגלים לחבר הסברים מפורטים ומרובי משפטים מתוך מקורות מידע חיצוניים.

  • בדיקת איכות סיכום והסבר

    מדידת ביצועי מודלי שפה ביצירת פסקאות תשובה נגישות לאדם ללא ידע מוקדם לפי מדד ROUGE.

  • מחקר על הטיות בפורומים

    ניתוח נקודות מבט מערביות וסגנון שיח בדיונים ציבוריים על מדע, היסטוריה וחברה.

איפה זה נופל

התוכן נכתב כולו על ידי גולשי רדיט באנגלית, כך שהוא מייצג נקודת מבט מערבית, בעיקר אמריקאית ואירופית, ואינו מהווה מקור מוסמך לעובדות. החוקרים הסירו שמות משתמשים אך השאירו שמות של אנשי ציבור שהוזכרו בדיונים. אין כאן עברית כלל, המידע נעצר באוגוסט 2019, והטקסטים עלולים להכיל הטיות תרבותיות והנחות יסוד של קהילת המקור שמסוכן להציג למשתמשי קצה כעובדות מוחלטות.

שאלות
נפוצות

האם אפשר להשתמש במאגר הזה לפיתוח מוצר מסחרי?

הרישיון מוגדר כלא ידוע והיוצרים עצמם הבהירו שהמעמד המשפטי של התוכן מרדיט אינו ברור. בנוסף רדיט הקשיחה את תנאי הגישה והשימוש בנתונים שלה. שילוב החומרים במוצר מסחרי כרוך בסיכון משפטי של ממש.

האם יש במאגר שאלות או תשובות בעברית?

אין במאגר עברית בכלל. כל הנתונים נאספו משלושה תתי פורומים דוברי אנגלית ברדיט. המאגר מתאים לעיבוד שפה טבעית באנגלית בלבד.

למה המאגר מסומן כלא פעיל ולא ניתן להורדה?

רדיט שינתה את תנאי הגישה לממשק הנתונים שלה וחסמה את מקור המידע החיצוני שבו השתמשו החוקרים. כתוצאה מכך קבצי המקור אינם זמינים עוד להורדה ישירה דרך Hugging Face. המאגר מכיל כעת רק את קובץ הסקריפט והתיעוד.

איך סוננו הנתונים כדי להבטיח את איכות התשובות?

החוקרים שמרו רק שאלות שקיבלו לפחות שתי הצבעות חיוביות ושיש להן לפחות תשובה אחת עם ציון שתיים ומעלה. בנוסף הוסרו קישורים ישירים והוחלפו בתוויות ייעודיות בתוך הטקסט. שאלות כפולות סוננו בעזרת מדד דמיון טקסטואלי כדי למנוע זליגה בין חלקי האימון והמבחן.

איך טוענים

המאגר מוגדר כרגע במצב מושבת ולא ניתן לגשת לקבצי המקור דרכו עקב חסימת ה־API של רדיט. במאגר שמורים רק קובץ הסקריפט eli5.py ותיעוד. אם יש לכם גישה לעותק מקומי, הטעינה דרך הספרייה מתבססת על סקריפט הפייתון, והשדות העיקריים לעבודה הם שדה הכותרת, טקסט ההרחבה ורשימת התשובות עם הניקוד המצורף לכל אחת.

from datasets import load_dataset

ds = load_dataset("defunct-datasets/eli5")

הרישיון

הרישיון מוגדר כלא ידוע. יוצרי המאגר מציינים מפורשות שהמעמד המשפטי תלוי ברישוי של נתוני Pushshift, שאינו ברור. שימוש מסחרי במודל שאומן על הנתונים האלה חושף אתכם לסיכון משפטי ישיר מול תנאי השימוש של רדיט, שאינם מתירים עוד גישה חופשית לנתונים.

הרישיון המלא ב־Hugging Face ↗