GPT
C

coqa

קוד פתוח

stanfordnlpother2022-03-02

  • conversational-qa

שיחות שאלות ותשובות באנגלית שנשענות על פסקאות טקסט משבעה תחומים שונים. המטרה כאן היא ללמד מודלים להתמודד עם שאלות המשך שתלויות בהקשר ולא עומדות בפני עצמן.

  • 4,012הורדות בחודש
  • 86לייקים

מה זה

כל רשומה מייצגת שיחה שלמה סביב קטע טקסט נתון. המבנה כולל את סיפור הרקע, רשימת שאלות בסגנון שיחתי, ותשובות בטקסט חופשי שמקושרות למיקום המדויק של הראיה בפסקה באמצעות נקודות התחלה וסיום.

הטקסטים נאספו משבעה מקורות שונים, כולל ויקיפדיה, ספרות, סיפורי ילדים ממאגר MCTest, מבחני בית ספר ממאגר RACE וחדשות ממאגר CNN של DeepMind. הכרטיס לא מפרט כיצד סוננו הנתונים בפועל או מי ביצע את המטלות.

בחלוקה של המאגר יש שני חלקים בלבד. קבוצת האימון כוללת 7,199 שיחות שמכילות את רוב 127 אלף השאלות, וקבוצת הוולידציה כוללת 500 שיחות נוספות.

מתאים ל

  • אימון צ'אטבוטים להבנת הקשר

    לימוד מודלים להבין שאלות קצרות שתלויות לחלוטין בתשובות ובמשפטים הקודמים בשיחה.

  • חילוץ מידע מבוסס מקורות

    בדיקת היכולת לספק תשובה מדויקת בטקסט חופשי תוך הצבעה על המיקום המדויק בפסקה.

  • מבחן ביצועים לשאלות ותשובות

    הערכת מודלי שפה על שיחות הבנת הנקרא מגוונות באמצעות סט הוולידציה המובנה.

איפה זה נופל

כל הטקסטים והשיחות הם באנגלית בלבד, כך שאין שום כיסוי לעברית או לשפות אחרות. המאגר פורסם במקור סביב שנת 2019 והועלה מחדש ב־2022, ולכן חלק מהעובדות או סגנון השיח ישנים יחסית.

הכרטיס משאיר סעיפים רבים ריקים תחת הכותרת שדרוש מידע נוסף. אין בו פירוט לגבי הטיות אפשריות, מידע רגיש, זהות המתייגים או המגבלות החברתיות של המידע, ולכן אי אפשר להסתמך עליו בעיניים עצומות במוצר סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון אינו אחיד ומורכב מכמה רישיונות שונים לפי מקור הטקסט. חלק מהטקסטים מגיעים תחת רישיון CC BY-SA או תחת רישיונות מחקריים של RACE ו־MCTest, שמגבילים שימוש כזה. שימוש מסחרי במאגר השלם בעייתי, ויש לבדוק כל מקור בנפרד לפני אימון מודל.

האם הדאטהסט כולל תמיכה בעברית?

המאגר כולו מבוסס על השפה האנגלית ואין בו נתונים בעברית כלל. הוא נאסף ממקורות תוכן דוברי אנגלית כמו ויקיפדיה ומאגרי חדשות באנגלית. כדי לעבוד בעברית תצטרכו לתרגם את הנתונים או לחפש מאגר שיחתי מקומי.

כמה מקום המאגר תופס והאם צריך משאבים כבדים לעבודה איתו?

הקבצים להורדה שוקלים 58.09 מגה בייט, ובסך הכל הוא תופס כ־77.33 מגה בייט בדיסק. מדובר בנפח קטן מאוד שאפשר לטעון במהירות בכל מחשב אישי רגיל. אין צורך בשרתים ייעודיים או בתשתיות אחסון מורכבות כדי לעבד אותו.

במה הוא שונה ממאגרי שאלות ותשובות רגילים כמו SQuAD?

בניגוד למאגרים שבהם כל שאלה עומדת בפני עצמה והתשובה היא העתק מדויק של קטע טקסט, כאן מדובר בשיחה מתמשכת. השאלות כוללות שאלות המשך קצרות שמסתמכות על העבר, והתשובות מנוסחות כטקסט חופשי לצד ציון המיקום של הראיה התומכת.

איך טוענים

המאגר זמין ישירות ללא צורך בהרשאה מוקדמת או באישור גישה. קבצי ההורדה שוקלים 58.09 מגה בייט, והנפח הכולל בדיסק מגיע ל־77.33 מגה בייט בפורמט Parquet.

בזמן עיבוד הנתונים צריך לשים לב למבנה השדות. השאלות מגיעות כמערך של מחרוזות, ושדה התשובות הוא מילון שמכיל את הטקסט החופשי לצד מיקומי התווים המדויקים של הראיות בתוך שדה הסיפור.

from datasets import load_dataset

ds = load_dataset("stanfordnlp/coqa")

הרישיון

המאגר מוגדר תחת רישיון מעורב ולא תחת רישיון אחיד בודד. ויקיפדיה והספרות מופצות תחת CC BY-SA 4.0 שדורש שיתוף זהה, החדשות ברישיון Apache, וקטעי הילדים והבחינות כפופים לרישיונות של MCTest ו־RACE. ערבוב הרישיונות הזה אומר שאי אפשר להשתמש בכל הדאטהסט בצורה מסחרית חופשית, וחובה לבודד רק את התחומים שמתאימים למטרות שלכם.

הרישיון המלא ב־Hugging Face ↗