GPT
D

duorc

קוד פתוח

ibm-researchmit2022-03-02

מאגר שאלות ותשובות באנגלית המבוסס על עלילות סרטים מוויקיפדיה ומ־IMDb. הוא נבנה כדי לבחון הבנת הנקרא מורכבת שבה השאלה והתשובה מסתמכות לעיתים על ניסוחים שונים של אותו הסיפור.

  • 7,823הורדות בחודש
  • 34לייקים

מה זה

הנתונים מחולקים לשתי תתי-קבוצות עיקריות: SelfRC ו־ParaphraseRC. בחלק של SelfRC עובדי Mechanical Turk קראו עלילות סרטים מוויקיפדיה, חיברו שאלות, וסימנו קטעי טקסט כתשובה או ניסחו תשובה עצמאית במילים שלהם.

החלק השני, ParaphraseRC, מציג אתגר קשה יותר. השאלות נלקחו מתוך התיאורים של ויקיפדיה, אבל המשיבים נדרשו לקרוא את תקציר העלילה המקביל מאתר IMDb ולענות לפיו בלבד. המבנה הזה מחייב את המודל להתמודד עם פראפרזות ולא להסתמך על התאמת מילים פשוטה בין השאלה לפסקה.

כל רשומה כוללת את מזהה העלילה, הטקסט המלא שלה, שם הסרט, מזהה השאלה, נוסח השאלה, רשימת תשובות אפשריות, ושדה בוליאני שמציין אם לשאלה יש תשובה בטקסט. החלוקה נעשתה כך שאף סרט שמופיע בסט האימון לא יופיע בבדיקה.

מתאים ל

  • אימון הבנת הנקרא אבסטרקטיבית

    פיתוח מודלים שמייצרים תשובות עצמאיות מתוך קטע טקסט במקום להעתיק ממנו ישירות.

  • בדיקת עמידות לפראפרזות

    בחינת יכולת המודל לענות על שאלות שנכתבו על בסיס מקור אחד באמצעות מקור מקביל ומנוסח אחרת.

  • זיהוי שאלות ללא מענה

    אימון מערכות לזהות מתי המידע הקיים בטקסט אינו מספיק כדי להחזיר תשובה לשאלה שנשאלה.

איפה זה נופל

הטקסטים מוגבלים לחלוטין לשפה האנגלית ומתמקדים אך ורק בעלילות של סרטים. אם אתם מחפשים מענה שאלות כללי, מסמכים משפטיים, רפואיים, או שיחות שירות, המבנה והסגנון כאן לא ייצגו את מה שתפגשו במוצר אמיתי. אין פה נתונים בעברית, והתיעוד המקורי אינו מפרט הטיות תרבותיות או חברתיות שקיימות בתיאורי הסרטים ובבחירות של עובדי המיקור-המוני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט משוחרר ברישיון MIT שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שמשאירים את הצהרת זכויות היוצרים של היוצרים המקוריים.

האם יש במאגר שאלות או תשובות בעברית?

לא. כל הנתונים נאספו באנגלית בלבד מתוך אתרי ויקיפדיה ו־IMDb.

מאיפה הגיעו השאלות והתשובות?

הן נוצרו על ידי עובדים בפלטפורמת Amazon Mechanical Turk. בחלק מהמקרים הם ענו ישירות מהטקסט שקראו, ובחלק אחר ענו על שאלות מקור אחד באמצעות קריאת מקור שני.

במה הוא שונה ממאגרי שאלות ותשובות רגילים כמו SQuAD?

במאגרים רגילים התשובה לרוב מועתקת ישירות כרצף מילים מתוך הפסקה. כאן נבדקת גם היכולת לענות על שאלות בניסוח שונה מעלילת המקור, וכן לייצר תשובה במילים עצמאיות.

איך טוענים

הקבצים שמורים בפורמט Parquet בחלוקה לתיקיות לפי שתי התצורות, SelfRC ו־ParaphraseRC. אין צורך בבקשת אישור גישה מיוחדת כדי למשוך את המידע. בעבודה מול הרשומות תצטרכו להחליט מראש לאיזו משימה אתם מאמנים: שליפת קטע טקסט קיים מתוך שדה העלילה, או יצירת תשובה חופשית שאינה מועתקת מילה במילה. חשוב לבדוק את השדה no_answer כדי לסנן שאלות שאין להן מענה בפסקה הנתונה.

from datasets import load_dataset

ds = load_dataset("ibm-research/duorc")

הרישיון

המאגר זמין תחת רישיון MIT. המשמעות היא שאתם רשאים להשתמש בו לצרכים מסחריים, לבצע התאמות, לאמן עליו מודלים ולהפיץ אותם, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין חובה לפתוח את הקוד שלכם או לשתף את המודל תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗