GPT
N

natural_questions

קוד פתוח

google-research-datasetscc-by-sa-3.02022-03-02

שאלות אמיתיות של משתמשים לצד ערכי ויקיפדיה שלמים שמכילים או לא מכילים את התשובה. המטרה כאן היא לאלץ מודלים להתמודד עם קריאת עמוד שלם ולא רק עם קטע טקסט קצר ומזוקק.

  • 80,657הורדות בחודש
  • 127לייקים

מה זה

המאגר כולל שאלות אותנטיות שמשתמשים חיפשו, כשלכל שאלה מוצמד דף ויקיפדיה שלם בפורמט HTML כולל הטוקנים שלו. המודל נדרש לאתר תשובה ארוכה שהיא לרוב פסקה שלמה, ותשובה קצרה וממוקדת של כמה מילים, או להחזיר תשובת כן ולא לפי התוכן שנמצא.

החלוקה כוללת 307,373 דוגמאות אימון ו־7,830 דוגמאות אימות בפיצול ברירת המחדל, לצד פיצול בדיקה נוסף עם 7,830 דוגמאות. הכרטיס לא מפרט את אופן הסינון הראשוני או את זהות המתייגים, אך הדגש הוא על קריאת טקסט רחב שבו ייתכן שאין תשובה כלל.

מתאים ל

  • אימון מנועי מענה לשאלות

    לימוד מודלים לאתר תשובות קצרות וארוכות מתוך מסמכי ויקיפדיה שלמים.

  • הערכת ביצועי מודלי שפה

    בדיקת יכולת המודל להתמודד עם שאלות חיפוש אמיתיות לעומת שאלות סינתטיות.

  • סיווג שאלות כן ולא

    אימון מערכות לספק תשובה בינארית של כן או לא על בסיס טקסט מקור נתון.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן תמיכה בעברית. המידע מבוסס על ויקיפדיה כפי שהייתה בעת יצירת המאגר במאמר מ־2019, ולכן עובדות רבות אינן מעודכנות. מעבר לכך, הכרטיס אינו מספק מידע על הטיות, סינון פרטים אישיים או אופן בחירת השאלות.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. כל השאלות וכל מסמכי ויקיפדיה במאגר כתובים באנגלית בלבד.

כמה מקום בדיסק צריך כדי לעבוד איתו?

ההורדה שוקלת 45.07 ג'יגה בייט, והדאטהסט שנוצר תופס 99.80 ג'יגה בייט. בסך הכל נדרשים לפחות 144.87 ג'יגה בייט פנויים בדיסק כדי להוריד ולפרוס אותו.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא cc-by-sa-3.0 שמתיר שימוש מסחרי, אך דורש מתן קרדיט והפצת יצירות נגזרות תחת אותו רישיון. אם אתם בונים מערכת קניינית סגורה, כדאי לבדוק היטב את תנאי השיתוף הזהה.

במה הוא שונה ממאגרי שאלות ותשובות אחרים?

במקום לתת למודל פסקה קצרה שבה התשובה בטוח נמצאת, המאגר מספק מאמר ויקיפדיה שלם. המודל צריך להבין לבד האם המסמך בכלל עונה על השאלה, ורק אז לאתר את הפסקה והמשפט המדויקים.

איך טוענים

ההורדה דורשת שטח אחסון משמעותי. קובצי המקור שוקלים 45.07 ג'יגה בייט, והנתונים לאחר פריסה תופסים 99.80 ג'יגה בייט, כך שצריך לפחות 144.87 ג'יגה בייט פנויים בדיסק. אין צורך באישור גישה מיוחד, והנתונים מחולקים למאות קובצי parquet. בעבודה עם הרשומות תעבדו בעיקר עם השדות document שמכיל את הטקסט וה־HTML, שדה question, והמערכים long_answers ו־short_answers תחת annotations לצורך חילוץ מיקומי התשובות.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/natural_questions")

הרישיון

הרישיון הוא cc-by-sa-3.0. מותר להשתמש בנתונים באופן מסחרי, אך חובה לתת קרדיט ליוצרים. בנוסף קיים סעיף שיתוף זהה, שמחייב אתכם להפיץ כל יצירה נגזרת או שינוי של המאגר תחת אותו רישיון בדיוק, נקודה שעלולה לסבך הפצה של מוצרים סגורים.

הרישיון המלא ב־Hugging Face ↗