GPT
T

trivia_qa

קוד פתוח

mandarjoshiunknown2022-03-02

המאגר מרכז מעל 650 אלף שלשות של שאלה, תשובה ומסמכי ראיות. חובבי טריוויה חיברו את השאלות במקור, והן מלוות בטקסטים שנאספו עצמאית כדי לאמן הבנת הנקרא.

  • 153,870הורדות בחודש
  • 203לייקים

מה זה

הרשומות בנויות סביב 95 אלף זוגות מקוריים של שאלות ותשובות, כשלכל שאלה צורפו בממוצע שישה מסמכי ראיות שנועדו לשמש פיקוח מרוחק. המבנה כולל את תוכן השאלה, מזהה, מקור השאלה, עמודי ישויות מוויקיפדיה ותוצאות חיפוש ברשת שמכילות קישורים ותקצירים. בנוסף, כל רשומה מחזיקה רשימות של שמות נרדפים לתשובה וערכים מנורמלים כדי לאפשר בדיקה גמישה של תשובות נכונות.

הנתונים מחולקים לתצורות שונות לפי הצורך באימון. תצורת הבנת הנקרא הרגילה, rc, מכילה את כל הטקסטים המלאים וכוללת 138,384 דוגמאות אימון, 18,669 דוגמאות אימות ו־17,210 דוגמאות בדיקה. לצדה קיימת תצורת rc.nocontext עם אותה חלוקה בדיוק אך ללא מסמכי הרקע, וכן גרסאות לא מסוננות שנקראות unfiltered עבור מי שרוצה לעבוד עם כלל המידע הגולמי שנאסף.

מתאים ל

  • אימון הבנת הנקרא

    חילוץ תשובות מתוך פסקאות מרובות מתוצאות חיפוש וויקיפדיה.

  • בדיקת ידע של מודלי שפה

    הערכת היכולת של מודל לענות על שאלות טריוויה ללא טקסט עזר.

  • אימון מערכות אחזור מידע

    דירוג ובחירת מסמכי הראיות הנכונים מתוך תוצאות החיפוש.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום ייצוג לעברית. השאלות נכתבו על ידי חובבי טריוויה, מה שמייצר הטיה ברורה לעובדות אנציקלופדיות ותרבות מערבית פופולרית. מסמכי הראיות נאספו בפיקוח מרוחק מתוך ויקיפדיה ותוצאות חיפוש, ולכן לא כל מסמך שנמצא מכיל הוכחה ישירה או נקייה לתשובה הנכונה, מה שעלול לייצר רעש באימון מערכות שמחפשות ציטוט מדויק.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד, הן בשאלות והן במסמכי הרקע שנאספו מהרשת ומתוך ויקיפדיה.

כמה מקום בדיסק צריך כדי לעבוד איתו?

הגרסה המלאה כולל כל הטקסטים תופסת 54.72 גיגה בייט בדיסק, שמתוכם 9.26 גיגה בייט הם קובצי ההורדה. אם בוחרים בגרסה ללא מסמכי הרקע, rc.nocontext, נדרשים רק כ־2.79 גיגה בייט בסך הכל.

האם אפשר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

הרישיון מוגדר כלא ידוע, ולכן אין היתר שימוש מסחרי מפורש. מומלץ לבדוק את האתר המקורי של החוקרים באוניברסיטת וושינגטון לפני שמשלבים את המידע בתהליכי אימון מסחריים.

מה ההבדל בין rc לבין rc.nocontext?

גרסת rc מכילה את מסמכי הראיות המלאים שנאספו עבור כל שאלה, ומיועדת למשימות קריאה והבנה של טקסט. גרסת nocontext כוללת רק את השאלות והתשובות בלי הטקסטים הגדולים מסביב, מה שהופך אותה למתאימה למשימות ידע כללי ישיר.

איך טוענים

טעינת המאגר המלא עם כל מסמכי ההקשר דורשת הורדה של 9.26 גיגה בייט, ובפתיחה מלאה על הדיסק התוכן תופס 45.46 גיגה בייט, כך שצריך לפחות 54.72 גיגה בייט פנויים. אם המטרה היא רק אימון על שאלות ותשובות בלי מסמכי המקור, עדיף לטעון את תצורת nocontext ששוקלת פחות מגיגה בייט אחד. הקבצים שמורים בפורמט פרקט, אין צורך בבקשת גישה מיוחדת, והשדות העיקריים לעבודה הם question, value והכינויים ברשימת aliases.

from datasets import load_dataset

ds = load_dataset("mandarjoshi/trivia_qa")

הרישיון

הרישיון המדווח במאגר הוא unknown, מה שאומר שהמפרסמים לא הגדירו רישיון ברור בקובץ. מבחינה מעשית, שימוש מסחרי במצב כזה הוא סיכון משפטי, כי אין הרשאה מפורשת להשתמש בטקסטים או להפיץ מודל שאומן עליהם. למחקר אקדמי זה בדרך כלל מספיק, אבל לבניית מוצר בחברה צריך לבדוק את תנאי השימוש בדף הבית המקורי של הפרויקט לפני שנוגעים בדאטה.

הרישיון המלא ב־Hugging Face ↗