GPT
C

commonsense_qa

קוד פתוח

taumit2022-03-02

שאלות רב ברירה באנגלית שדורשות הבנה והיגיון יומיומי. המאגר בודק אם מודל מסוגל לבחור את התשובה הנכונה מתוך חמש אפשרויות על בסיס ידע בסיסי.

  • 288,365הורדות בחודש
  • 153לייקים

מה זה

המאגר מכיל 12,102 שאלות רב ברירה באנגלית, כאשר לכל שאלה מוצמדות חמש אפשרויות תשובה: אחת נכונה וארבע מסיחות. המטרה היא לבחון ידע של שכל ישר שאינו מצוין במפורש בטקסט אלא דורש היקש. כל רשומה כוללת מזהה ייחודי, טקסט השאלה, מושג מקשר מתוך מאגר ConceptNet, מילון של חמש האפשרויות עם אותיות זיהוי, והאות של התשובה הנכונה.

החלוקה הפנימית במאגר כוללת 9,741 דוגמאות לאימון, 1,221 לאימות ו־1,140 למבחן. הנתונים מתבססים על מושגים מתוך רשת הידע ConceptNet, אך פרטי תהליך האיסוף, הסינון והמתייגים עצמם אינם מפורטים בדף המאגר. המחקר המקורי הציע שתי חלוקות עיקריות, חלוקה אקראית וחלוקה לפי מילות שאלה, כאשר כאן מוצגת החלוקה הסטנדרטית.

מתאים ל

  • בנצ'מרק ליכולות שכל ישר

    בדיקת יכולת המודל לבחור תשובה הגיונית מתוך חמש אפשרויות.

  • אימון מודלים למענה לשאלות

    כוונון עדין על שאלות רב ברירה שמבוססות על קשרים בין מושגים.

  • השוואת מודלים בשפה האנגלית

    מדידת ביצועים מול נתוני עבר במחקר על סט המבחן הקיים.

איפה זה נופל

המאגר כולו באנגלית בלבד ולא קיים בו תוכן בעברית. כרטיס המאגר משאיר שדות רבים ריקים ואינו מפרט הטיות, תהליכי איסוף או מגבלות חברתיות. הנתונים פורסמו במקור במאמר מ־2019 והועלו ב־2022, כך ששאלות שמבוססות על נורמות תרבותיות או ידע עכשווי עלולות להיות מיושנות. לפני שילוב במערכת פעילה צריך לוודא שהשאלות מתאימות לקהל היעד שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר מפורסם תחת רישיון MIT, שמאפשר שימוש מסחרי מלא. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

כמה שטח דיסק נדרש כדי להוריד את הנתונים?

הקבצים קטנים מאוד. ההורדה דורשת 4.68 מגה בייט, והדאטהסט המיוצר תופס 2.18 מגה בייט, כך שסך הכל נדרשים פחות מ־7 מגה בייט בדיסק.

האם הדאטהסט כולל שאלות בעברית?

לא. כל הנתונים במאגר מופיעים באנגלית בלבד, ואין בו תרגום או תמיכה מובנית בשפות נוספות.

מה מקור השאלות במאגר?

השאלות נבנו סביב מושגים מתוך רשת הידע ConceptNet. פרטי תהליך הכתיבה המלאים של השאלות והתשובות אינם מופיעים בכרטיס המאגר ומוסברים במאמר המדעי המקורי מ־2019.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה tau/commonsense_qa ללא צורך באישור גישה. קובצי הנתונים שמורים בפורמט Parquet, שוקלים יחד כ־4.7 מגה בייט להורדה ותופסים פחות מ־7 מגה בייט בדיסק. השדות החשובים לעבודה הם question, המילון choices שמכיל את רשימת התשובות והתוויות, והשדה answerKey שמכיל את תווית התשובה הנכונה.

from datasets import load_dataset

ds = load_dataset("tau/commonsense_qa")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית ונוסח הרישיון. אין דרישה לפתוח מודלים שאומנו עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗