GPT
W

web_questions

קוד פתוח

stanfordnlpunknown2022-03-02

מאגר קלאסי של שאלות ותשובות קצרות שנאספו מהרשת ומיועדות למענה מול גרף ידע. מי שבוחר בו מחפש בנצ'מרק פשוט ומוכר לשאלות מבוססות ישות יחידה.

  • 11,615הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל בסך הכל 6,642 צמדים של שאלות ותשובות באנגלית, שמבוססים על שאלות פופולריות שנשאלו ברשת בשנת 2013. הרעיון המקורי של החוקרים היה לבנות שאלות שניתן לענות עליהן באמצעות גרף הידע Freebase, ולכן רוב השאלות מתרכזות סביב ישות אחת מוגדרת.

כל רשומה בנויה משלושה שדות: מחרוזת של השאלה, רשימת תשובות טקסטואליות אפשריות, וכתובת קישור לישות המתאימה ב־Freebase. הנתונים מחולקים לשני חלקים בלבד, כאשר חלק האימון מכיל 3,778 דוגמאות וחלק הבדיקה מכיל 2,032 דוגמאות. הכרטיס לא מפרט כיצד בדיוק בוצע הסינון הראשוני של השאלות או מי תייג את התשובות.

מתאים ל

  • בנצ'מרק למענה על שאלות

    הערכת ביצועים של מודלים מול שאלות מבוססות עובדות קצרות באנגלית.

  • אימון קישור לגרפי ידע

    מיפוי שאלות בשפה טבעית לישויות ספציפיות בעזרת שדה הקישור המצורף.

  • ניתוח תחבירי סמנטי

    בדיקת יכולת המודל לפרק שאלה סביב ישות בודדת ולהפיק תשובה מדויקת.

איפה זה נופל

הנתונים נאספו בשנת 2013, כך שחלק גדול מהעובדות או השאלות הפופולריות כבר לא רלוונטיות או שהתשובות להן השתנו מאז. בנוסף, כל המאגר בנוי באנגלית בלבד וסובב סביב ישויות ב־Freebase, פרויקט שכבר אינו פעיל. כרטיס המאגר ריק לחלוטין בנושאי הטיות, פרטיות, ומגבלות חברתיות, כך שאין תיעוד רשמי של בעיות במידע. אם אתם בונים מערכת מודרנית לשאלות ותשובות, אי אפשר להסתמך עליו כמקור יחיד ללא בדיקה של עדכניות הנתונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי מוגדר כלא ידוע, ואין בכרטיס שום פירוט על תנאי השימוש. בגלל שאין היתר מסחרי מפורש, לא כדאי להשתמש בו לאימון מודל שמיועד למוצר מסחרי מחשש להפרת זכויות יוצרים.

כמה מקום המאגר תופס בדיסק?

הקבצים קטנים במיוחד. ההורדה שוקלת 1.27 מגה בייט, והנפח הכולל בדיסק אחרי פריסה הוא 2.10 מגה בייט בלבד.

האם יש במאגר תמיכה בעברית?

לא. כל השאלות והתשובות נאספו באנגלית בלבד, ואין ייצוג לשפות אחרות במאגר הזה.

מאיפה הנתונים הגיעו במקור?

השאלות נאספו מחיפושים פופולריים ברשת בשנת 2013, במטרה לבדוק מענה על שאלות מול ישויות בגרף הידע Freebase. כל רשומה כוללת קישור לישות המתאימה במערכת ההיא.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face. המאגר ציבורי, לא דורש הרשמה מיוחדת או אישור גישה, והמשקל הכולל בדיסק זניח לחלוטין ועומד על 2.10 מגה בייט בסך הכל. הנתונים שמורים בקובצי Parquet נפרדים לאימון ולבדיקה. בזמן העבודה תצטרכו להתמקד בעיקר בשדות question ו־answers, כאשר שדה התשובות מגיע כמערך מחרוזות ולא כמחרוזת בודדת.

from datasets import load_dataset

ds = load_dataset("stanfordnlp/web_questions")

הרישיון

הרישיון המדווח במאגר הוא unknown, וכרטיס הנתונים לא מפרט תחת איזה רישיון החומרים שוחררו. המצב הזה מציב סיכון משפטי ברור לשימוש מסחרי, כיוון שאין היתר מפורש להפיץ, לעבד או לאמן מודלים לצרכים מסחריים. בפועל זה אומר שאי אפשר לשלב אותו בבטחה במוצר מסחרי, ומומלץ להגביל את השימוש בו למחקר אקדמי בלבד.

הרישיון המלא ב־Hugging Face ↗