GPT
D

definite_pronoun_resolution

קוד פתוח

community-datasetsunknown2022-03-02

מאגר לבדיקת היכולת של מודלים לפענח כינויי גוף בטקסט. הוא מתאים למי שרוצה לבחון הבנה שפתית והסקה מורכבת מול זוגות משפטים שנכתבו במיוחד כדי לאתגר מערכות.

  • 18,573הורדות בחודש
  • 14לייקים

מה זה

המאגר כולל משפטים באנגלית שבהם מופיע כינוי גוף, כשעבור כל אחד מוגדרים שני מועמדים אפשריים להחלפה והתיוג קובע מי מהם נכון. אם כינוי הגוף חוזר על עצמו במשפט, המטרה היא תמיד המופע הראשון שלו. התוכן נכתב במקור על ידי שלושים סטודנטים לתואר ראשון בארצות הברית, והוא מקיף נושאים מאקטואליה אמיתית, דרך תרבות פופולרית ודמויות כמו באטמן, ועד לתרחישים מומצאים לגמרי.

הנתונים מחולקים לשני חלקים בלבד תחת התצורה plain_text: אימון עם 1322 דוגמאות ובדיקה עם 564 דוגמאות. כל רשומה מורכבת מהמשפט המקורי, הכינוי המבוקש, רשימת המועמדים והתווית שמפנה לאינדקס הנכון, אפס או אחת.

מתאים ל

  • הערכת הבנת הנקרא

    בדיקת יכולת המודל לזהות לאיזה שם עצם מתייחס כינוי גוף במשפט מורכב.

  • מבחן מבחן וינוגרד

    בחינת יכולות הסקה והיגיון בסיסי במודלים, בהתבסס על אתגר סכמות וינוגרד.

  • בנצ'מרק לסיווג שמות

    מדידת דיוק של מסווגים על בעיה בינארית מוגדרת היטב עם שתי אפשרויות.

איפה זה נופל

הנתונים נכתבו על ידי סטודנטים אמריקאים שנולדו בתחילת שנות התשעים, והכרטיס מציין במפורש שהתוכן משקף את תפיסת העולם ותרבות הפופ של אותה קבוצה ספציפית. הטקסטים הם באנגלית בלבד, כך שאין שום כיסוי לעברית. בנוסף, המאגר זעיר בהיקפו ומבוסס על כנס מ־2012, כך שהוא לא מתאים לאימון של מודלי שפה גדולים מאפס אלא רק להערכה או לבדיקת יכולות נקודתית.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיון מוגדר כלא ידוע ולא סופק מידע רשמי לגביו בכרטיס. עבור מוצרים מסחריים מומלץ לא להשתמש בו לפני בירור מול מחברי המאמר מ־2012.

האם יש במאגר תמיכה בעברית?

לא, כל הנתונים נכתבו באנגלית בלבד על ידי דוברי השפה. אין בו דוגמאות בעברית או תרגום מובנה.

כמה שטח אחסון צריך בשביל להוריד אותו?

הקבצים קטנים מאוד ותופסים פחות מחצי מגה בייט בסך הכל על הדיסק. ההורדה מיידית ואינה דורשת משאבי חומרה מיוחדים.

איך נאסף הטקסט בפועל?

שלושים סטודנטים בקורס אקדמי כתבו זוגות משפטים על אירועים אמיתיים, סרטים ודמיונם האישי. הדוגמאות נבנו ותויגו ידנית כדי ליצור אתגרי פענוח כינויים.

איך טוענים

טוענים את המאגר ישירות בעזרת פקודת load_dataset הרגילה של ספריית datasets עם השם המלא שלו. קובצי הנתונים שמורים בפורמט parquet, והמשקל הכולל שלהם זעיר במיוחד ועומד על פחות מחצי מגה בייט, כך שהטעינה מסתיימת תוך שניות בודדות. אין צורך באישורי גישה מיוחדים, והשדות העיקריים שצריך לגשת אליהם בקוד הם sentence, pronoun, candidates והערך הבינארי בשדה label.

from datasets import load_dataset

ds = load_dataset("community-datasets/definite_pronoun_resolution")

הרישיון

הרישיון המדווח במאגר מוגדר כלא ידוע, ואין בכרטיס שום פירוט על תנאי השימוש. במצב כזה אי אפשר לדעת אם מותר להשתמש בנתונים לצרכים מסחריים, מהן דרישות הייחוס, או אם נגזרות של מודלים שמאומנים עליו מוגבלות משפטית. מי שמתכנן להכניס את הדאטה למוצר מסחרי לוקח סיכון משפטי וצריך לבדוק את המקור האקדמי של המאמר מ־2012.

הרישיון המלא ב־Hugging Face ↗