GPT
N

narrativeqa

קוד פתוח

deepmindapache-2.02022-03-02

מאגר שמיועד להבנת הנקרא על מסמכים ארוכים כמו ספרים ותסריטים מלאים. מי שבוחר בו רוצה לבחון יכולת הסקת מסקנות עלילתית ולא רק איתור התאמות שטחיות.

  • 10,045הורדות בחודש
  • 69לייקים

מה זה

כל רשומה כוללת צמד של שאלה ותשובה לצד הסיפור המלא או תקציר ויקיפדיה שלו. הטקסטים המקוריים הגיעו מספרים של פרויקט גוטנברג ומאתרי תסריטים, בעיקר IMSDb. הצוות התאים את היצירות לתקצירי עלילה מויקיפדיה ובדק את ההתאמות ידנית.

השאלות והתשובות נוצרו על ידי עובדי אמזון טורק, שקיבלו רק את התקציר והתבקשו לחבר שאלות שבודקות אדם שקרא את היצירה המלאה. הם הודרכו להימנע משאלות כן ולא, לכתוב במילים שלהם ולא להעתיק. החלוקה נעשתה לפי יצירות שלמות כדי למנוע זליגה, עם 32,747 דוגמאות באימון, 3,461 בוולידציה ו־10,557 בטסט.

מתאים ל

  • הערכת הבנת מסמכים ארוכים

    בדיקת יכולת המודל לענות על שאלות הדורשות סריקה של עשרות אלפי מילים בספר או תסריט.

  • מענה שאלות מתקצירים

    אימון מודלים לייצור תשובות תמציתיות ומדויקות מתוך פסקאות סיכום של עלילה.

  • אימון מודלי הפשטה

    תרגול מודלים בניסוח תשובה עצמאית במילים חדשות במקום שליפת משפט ישיר מתוך הטקסט.

איפה זה נופל

החומר באנגלית בלבד ואין בו שום נגיעה לעברית. מקורות הטקסט הם יצירות ישנות יחסית מפרויקט גוטנברג ותסריטים חופשיים, כך שהשפה עשויה להיות מיושנת או ייחודית לתסריטים. הכרטיס לא מפרט הטיות או מגבלות נוספות, אך נקודת התורפה הברורה היא שהשואלים קראו רק את התקציר. כתוצאה מכך, השאלות עשויות להתמקד בעיקר באירועים מרכזיים שמופיעים בוויקיפדיה ולא בפרטים שקיימים רק בעומק הספר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון Apache 2.0 מתיר שימוש מסחרי מלא ללא תשלום. חובה לצרף עותק של הרישיון וכתב הוויתור בהפצה של הקוד או הדאטה.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים, כולל הספרים, התסריטים, השאלות והתשובות, כתובים באנגלית בלבד.

איך נאספו השאלות והתשובות?

עובדי אמזון טורק קראו את תקצירי הוויקיפדיה וחיברו שאלות ותשובות שמדמות מבחן הבנה על הסיפור המלא. נאסר עליהם להעתיק משפטים ישירות ונאסר לייצר שאלות של כן ולא.

במה המאגר הזה שונה ממאגרי הבנת נקרא רגילים?

ברוב המאגרים התשובה נמצאת ישירות בפסקה בודדת, כאן היא דורשת לעבד ספרים ותסריטים שלמים. בנוסף, השאלות נכתבו מתוך תקציר, ולכן המענה מתוך הטקסט המלא מחייב הבנה עמוקה של העלילה.

איך טוענים

המאגר ציבורי לחלוטין ואין צורך לבקש הרשאות גישה. הנתונים מגיעים בקובצי Parquet מחולקים יחד עם קובצי zip שמכילים את הטקסטים המלאים. בשליפה כדאי לשים לב לשדות document.kind שמבדיל בין ספר לתסריט, document.summary.text שמכיל את התקציר, ושדות השאלות והתשובות שכוללים גם טקסט חופשי וגם ייצוג מחולק למילים.

from datasets import load_dataset

ds = load_dataset("deepmind/narrativeqa")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. הוא אינו כופה שיתוף באותו רישיון, ומודל שאומן עליו אינו מחויב להיפתח לציבור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗