GPT
D

drop

קוד פתוח

ucinlpcc-by-sa-4.02022-03-02

המאגר כולל עשרות אלפי שאלות שדורשות פעולות חישוב, ספירה ומיון מתוך פסקאות טקסט. הוא מתאים למי שרוצה לבדוק אם המודל מבין תוכן לעומק ולא רק מחפש מילות מפתח.

  • 23,997הורדות בחודש
  • 70לייקים

מה זה

הנתונים נאספו במיקור המונים ונבנו בצורה אדברסרית במטרה לאתגר מודלים להבנת הנקרא. כל רשומה כוללת פסקת מקור, שאלה, ומבנה תשובות עם מקטעי הטקסט המתאימים. בניגוד למבחני שליפת מידע פשוטים, השאלות כאן מכריחות לחבר מידע מכמה מקומות בטקסט ולבצע עליו מניפולציות כמו חיבור מתמטי או מיון כרונולוגי.

המאגר מחולק לשני חלקים בלבד, ללא סט בדיקה גלוי. החלק של האימון מכיל 77,409 דוגמאות, וחלק האימות מכיל 9,536 דוגמאות. כרטיס המאגר לא מפרט על תהליך הסינון המדויק או על זהות כותבי הטקסטים המקוריים.

מתאים ל

  • בנצ'מרק להסקה דיסקרטית

    בדיקת יכולת המודל לבצע חיבור, השוואה וספירה מעל פסקאות טקסט מורכבות.

  • אימון למענה על שאלות

    כוונון עדין של מודלים למשימות שדורשות הצלבת עובדות מרובות מתוך קטע נתון.

  • הערכת עמידות אדברסרית

    מבחן ביצועים מול שאלות מכשילות שנכתבו בכוונה כדי להפיל מודלים סטנדרטיים.

איפה זה נופל

הכרטיס עצמו דל בפרטים ולא מפרט הטיות מובנות, מגבלות חברתיות או מידע על פרטיות. כל הדוגמאות באנגלית בלבד, ואין כאן עברית כלל. בנוסף, חסר סט מבחן סופי, כך שכל ההערכה נשענת על סט האימות. המאגר פורסם במקור במאמר מ־2019 והועלה מחדש ב־2022, ולכן הטקסטים והסגנון מתאימים לנקודת הזמן ההיא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מתיר שימוש מסחרי, אבל כולל דרישת שיתוף זהה מסוג ShareAlike. המשמעות היא שאם תפיצו מודל שאימנתם על הדאטה, ייתכן שתחויבו לפתוח אותו תחת אותו רישיון חופשי.

כמה שטח אחסון צריך בשביל להוריד אותו?

ההורדה קטנה מאוד ושוקלת 8.30 מגה בייט בלבד. לאחר פריסה וטעינה המאגר תופס 119.21 מגה בייט בדיסק.

האם יש במאגר שאלות או טקסטים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל הפסקאות, השאלות והתשובות נאספו ונכתבו באנגלית.

איך השאלות במאגר נוצרו?

השאלות נוצרו באמצעות עובדי מיקור המונים בצורה אדברסרית. המטרה היתה לנסח שאלות שדורשות הבנה מקיפה, פעולות לוגיות וחישוב, מעבר לשליפת מילים פשוטה מהטקסט.

איך טוענים

טוענים את המאגר ישירות מתוך ספריית הנתונים באמצעות המזהה ucinlp/drop. אין צורך באישור גישה מיוחד, והקבצים שמורים בפורמט parquet. נפח ההורדה המכווץ עומד על 8.30 מגה בייט, ובדיסק הוא תופס סביב 119.21 מגה בייט בסך הכל. השדות שמעבדים הם passage לטקסט המקור, question לשאלה, ו־answers_spans שמחזיר רשימת מחרוזות עם התשובות הנכונות.

from datasets import load_dataset

ds = load_dataset("ucinlp/drop")

הרישיון

הרישיון המדווח הוא cc-by-sa-4.0. הוא מתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מלא ליוצרים ומשתפים כל יצירה נגזרת תחת אותו רישיון בדיוק. סעיף השיתוף הזהה עשוי לחול גם על מודל שתאמנו על הנתונים, ולכן שימוש במוצר קנייני סגור מסוכן כאן מאוד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗