GPT
P

PopQA

קוד פתוח

akariasaiרישיון לא דווח2022-12-22

המאגר מרכז 14 אלף שאלות ותשובות מבוססות ישויות, שנוצרו מתבניות על גבי ויקינתונים. הוא כולל נתוני צפיות חודשיות בוויקיפדיה כדי לבדוק איך פופולריות של נושא משפיעה על זיכרון של מודלים.

  • 9,815הורדות בחודש
  • 45לייקים

מה זה

כל רשומה כאן מייצגת שאלה ותשובה שנבנו מתוך שלשות מידע של ויקינתונים. במקום לאסוף שאלות טבעיות של בני אדם, המחברים לקחו ישות נושא, יחס וישות מושא, והמירו אותן לשאלה סגורה באמצעות תבנית קבועה מראש. המאגר כולל את השאלה המנוסחת לצד רשימת תשובות אפשריות שנחשבות נכונות.

המבנה של הנתונים עשיר בפרטים טכניים על הישויות עצמן. לכל ישות מצורפים המזהים הייחודיים שלה מוויקינתונים, שמות חלופיים, קישורי הדפים, וגם כמות הצפיות החודשית בדפי ויקיפדיה של הנושא ושל המושא. הנתונים מגיעים בקובץ יחיד, test.tsv, שמעיד כי המאגר מיועד בעיקר למבחן והערכה ולא לאימון רחב.

מתאים ל

  • מדידת זיכרון במודלים

    בדיקה אם מודל שפה שולף עובדות מדויקות על ישויות נדירות לעומת מוכרות.

  • הערכת מערכות RAG

    בחינה של שליפת מידע חיצוני עבור עובדות עם מעט צפיות בוויקיפדיה.

  • ניתוח הזיות לפי פופולריות

    כימות נטיית המודל להמציא תשובות כששואלים אותו על ישויות אזוטריות.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין בהם שום תמיכה בעברית. השאלות נוצרו מתבניות אוטומטיות ולא נכתבו באופן טבעי, כך שהן לא משקפות ניסוחים אמיתיים או סגנונות חיפוש של אנשים. המאגר פורסם בסוף 2022 ומתבסס על צפיות ומידע מוויקינתונים מהתקופה הזו, לכן כל שינוי שקרה בעולם מאז לא נמצא כאן. בנוסף, חסרה חלוקת אימון וולידציה, והכרטיס מכיל רק קובץ מבחן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות זאת כרגע, מכיוון שלא דווח שום רישיון במאגר. בהיעדר תנאי שימוש מוגדרים, הנתונים מוגנים בזכויות יוצרים ואי אפשר להסתמך עליהם מסחרית. לשימוש כזה תצטרכו לפנות ישירות ליוצרים.

כמה שוקל המאגר ואיך מקבלים אליו גישה?

הקובץ המרכזי שוקל 5.2 מגה בייט בלבד וזמין להורדה חופשית. המאגר פתוח לציבור ואינו דורש הרשמה מיוחדת או אישור גישה ידני מבעלי המאגר. אפשר למשוך את קובץ ה־tsv ישירות ולהתחיל לנתח אותו מקומית.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומכיל דוגמאות בשפה האנגלית בלבד. כל הישויות, התבניות והשאלות נבנו מתוך ויקיפדיה וויקינתונים באנגלית. כדי להשתמש בו בהקשר ישראלי תצטרכו לתרגם את השאלות או לייצר מאגר מקביל בעצמכם.

איך נאספו השאלות שמופיעות בקובץ?

המחברים שלפו שלשות של מידע מובנה מתוך ויקינתונים, הכוללות נושא, מושא ויחס. שלשות אלו הומרו לשאלות באנגלית בעזרת תבניות אוטומטיות קבועות. לכל שאלה צורפו שמות חלופיים של הישויות ונתוני צפיות חודשיות בוויקיפדיה.

איך טוענים

המאגר שוקל 5.2 מגה בייט בלבד ומכיל קובץ בדיקה בשם test.tsv, כך שטוענים אותו ישירות בלי צורך באישור גישה מיוחד או בהמתנה ארוכה. כדי להתחיל לעבוד איתו צריך להתמקד בשדה question שבו מופיעה השאלה, ובשדה possible_answers שמרכז את התשובות הנכונות. שדות הצפיות s_pop ו־o_pop הם אלה שמאפשרים לחלק את המבחנים לפי רמות הפופולריות של הישויות.

from datasets import load_dataset

ds = load_dataset("akariasai/PopQA")

הרישיון

היוצרים לא הגדירו רישיון עבור המאגר. מבחינה משפטית, כשאין רישיון מוצהר אסור להשתמש בנתונים למוצר מסחרי, וכל שימוש כזה יוצר חשיפה משפטית ברורה. כדאי להגביל את העבודה עם הקבצים למחקר אקדמי פנימי, או לפנות לכותבי המאמר כדי לקבל מהם אישור שימוש כתוב ומפורש.

הרישיון המלא ב־Hugging Face ↗