GPT
N

nq_open

קוד פתוח

google-research-datasetscc-by-sa-3.02022-03-02

שאלות אמיתיות ממנוע החיפוש של גוגל עם תשובות קצרות באנגלית. מתאים למי שבונה או בודק מערכות מענה לשאלות בעולם פתוח.

  • 27,758הורדות בחודש
  • 35לייקים

מה זה

המאגר מציע גרסה פתוחה ומזוקקת של Natural Questions, שבה המודל נדרש לענות על שאלה ללא טקסט מקור מצורף. השאלות מגיעות משאילתות חיפוש אמיתיות של משתמשים בגוגל, ולכן הן משקפות צרכי מידע אותנטיים של אנשים שלא ידעו את התשובה מראש. כל התשובות ניתנות לאימות מתוך ויקיפדיה באנגלית.

בניגוד למאגר המקורי שכלל פסקאות שלמות, כאן סיננו את הנתונים והשאירו רק שאלות עם תשובות קצרות. תשובות עם יותר מחמישה טוקנים נזרקו החוצה, כדי להימנע מקטעי טקסט ארוכים שמתפקדים כציטוט ולא כתשובה ישירה.

הנתונים מחולקים לשני חלקים בלבד. קובץ האימון מכיל 87,925 דוגמאות, וקובץ הוולידציה מכיל 3,610 דוגמאות. המבנה פשוט מאוד וכולל שני שדות בלבד לכל רשומה, מחרוזת השאלה ורשימה של תשובות אפשריות.

מתאים ל

  • בנצ'מרק למענה בעולם פתוח

    בדיקת יכולת המודל לחלץ תשובה נכונה לשאלות משתמשים אמיתיות מתוך מאגר ידע חיצוני.

  • אימון שליפה ומענה קצר

    אימון מערכות מבוססות חיפוש להחזרת ערכים תמציתיים של עד חמישה טוקנים.

  • הערכת מודלי שפה על עובדות

    מדידת הזיכרון הפרמטרי של המודל ביחס לעובדות מוויקיפדיה באנגלית ללא הקשר מצורף.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין כאן עברית כלל. התשובות מבוססות על ויקיפדיה באנגלית והוגבלו לעד חמישה טוקנים, כך שאי אפשר להשתמש בזה למענה על שאלות שמצריכות הסבר מורכב או נימוק. הכרטיס מודה בהטיה מובנית בתהליך התיוג, שבו המתייגים השתמשו בכלים אוטומטיים כדי למצוא את התשובות, מה שעלול לייצר הטיה לטובת תוצאות שהכלים האלה הציגו. פרטים רבים לגבי זהות המתייגים ומידע רגיש מסומנים כחסרים בכרטיס המקורי.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא, הנתונים מופיעים באנגלית בלבד. כל השאלות נאספו ממשתמשי גוגל באנגלית והתשובות אומתו מול ויקיפדיה באנגלית.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא cc-by-sa-3.0 ולכן הוא מתיר שימוש מסחרי ומחייב מתן קרדיט. עם זאת, סעיף השיתוף הזהה מחייב להפיץ יצירות נגזרות תחת אותו רישיון, מה שמחייב בדיקה משפטית לפני שילוב במוצר סגור.

מה ההבדל בין המאגר הזה לבין Natural Questions המקורי?

בגרסה הזו הסירו את כל פסקאות המקור הארוכות והשאירו רק את צמד השאלה והתשובה. בנוסף, נשמרו רק שאלות עם תשובות קצרות באורך של עד חמישה טוקנים.

כמה רשומות יש בסך הכל?

ישנן 87,925 רשומות בחלק האימון ועוד 3,610 רשומות בחלק הוולידציה. ביחד מדובר על קצת יותר מ־91 אלף זוגות של שאלות ותשובות.

איך טוענים

המאגר יושב בפורמט פרקט וכולל ארבעה קבצים, כך שטוענים אותו ישירות בלי צורך בבקשת גישה מיוחדת או באישור. המבנה פשוט וקל לעיבוד, כשרק צריך לקרוא את שדה השאלה question ואת רשימת התשובות הקצרות answer. משקל הנתונים קטן מאוד ביחס לדאטהסטים גולמיים כי מסמכי המקור הוסרו לחלוטין.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/nq_open")

הרישיון

הרישיון הוא cc-by-sa-3.0. מותר להשתמש בנתונים, לשנות אותם ואף לעשות בהם שימוש מסחרי, אך חובה לתת ייחוס מתאים ליוצרים. המכשול המרכזי הוא תנאי השיתוף הזהה, שמחייב אתכם להפיץ כל יצירה נגזרת תחת אותו הרישיון בדיוק. אם אתם מאמנים מודל או בונים נגזרת ישירה, צריך לבדוק משפטית כיצד תנאי השיתוף הזהה משפיע על הפצת המודל שלכם.

הרישיון המלא ב־Hugging Face ↗