GPT
A

adversarial_qa

קוד פתוח

UCLNLPcc-by-sa-4.02022-03-02

מאגר שאלות ותשובות שנוצר כדי לשבור מודלים חזקים, באמצעות כותבים אנושיים שניסו להכשיל אותם בלופ אינטראקטיבי. הוא מיועד למי שרוצה לאמן או לבחון מודל על דוגמאות קשות באמת.

  • 12,418הורדות בחודש
  • 44לייקים

מה זה

המאגר מכיל קטעי קריאה מתוך ויקיפדיה באנגלית, שנלקחו ישירות מהדאטהסט המקורי של SQuAD 1.1, לצד שאלות ותשובות שנכתבו במיוחד כדי להקשות על מערכות עיבוד שפה. הרעיון היה פשוט אך קשוח: מתייגים אנושיים קיבלו קטע טקסט וסימנו בו תשובה, וניסחו שאלה תוך כדי ניסיון מכוון להטעות מודל קיים. אם המודל ענה נכון, המתייג נאלץ לנסח את השאלה מחדש עד שהמודל טעה.

המבנה מחולק לשלושה תתי מאגרים נפרדים לפי המודל שהוכשל בלולאת האיסוף: BiDAF, BERT-Large, ו־RoBERTa-Large. בכל אחד משלושת החלקים האלה יש 10,000 דוגמאות אימון, 1,000 דוגמאות ולידציה ו־1,000 דוגמאות בדיקה. בסך הכל המאגר כולל 36,000 רשומות, והוא שומר על הפורמט המוכר של SQuAD עם שדות של כותרת הערך, פסקת המקור, מזהה ייחודי וטקסט התשובה עם מיקום התו ההתחלתי שלה.

מתאים ל

  • הערכת עמידות מודלים

    בדיקת ביצועי מערכות הבנת הנקרא על שאלות שנכתבו במטרה להכשיל אלגוריתמים.

  • אימון למניעת התאמת יתר

    הוספת דוגמאות מאתגרות לתהליך האימון כדי שהמודל לא יישען על דמיון שטחי בין מילים.

  • השוואת ביצועים מול SQuAD

    מדידת הפער ביכולת המודל בין שאלות סטנדרטיות לשאלות שנבנו בלולאת איסוף אדברסרית.

איפה זה נופל

כל הטקסט במאגר מבוסס על ויקיפדיה באנגלית בלבד, כך שאין כאן שום כיסוי לעברית או לשפות אחרות, וסגנון הכתיבה מוגבל לאנציקלופדי. המודלים ששימשו כיריבים באיסוף הם מדורות קודמים כמו BERT ו־RoBERTa, ולכן שאלות שהכשילו אותם אז עשויות להיות פשוטות בהרבה עבור מודלים עדכניים. בנוסף, המתייגים הונחו במפורש למצוא ניסוחים מתחכמים כדי לנצח את המכונה, מה שמייצר הטיות אלגוריתמיות וניסוחי שאלות שלעיתים מרגישים מאולצים ולא מייצגים שאלות טבעיות של משתמשי קצה במוצר אמיתי.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מערכות בעברית?

לא, המאגר מורכב כולו מקטעי ויקיפדיה ושאלות באנגלית ללא תרגום או התאמה לשפות אחרות. כדי להשתמש בו בעברית תצטרכו לתרגם אותו לחלוטין או לחפש מאגרי הבנת הנקרא מקומיים. שימוש ישיר יתאים רק למערכות שמיועדות לעיבוד טקסט באנגלית.

איך הדאטהסט הזה נאסף בפועל?

החוקרים העסיקו עובדים דרך Mechanical Turk בארצות הברית, בריטניה וקנדה שכתבו שאלות מול ממשק אינטראקטיבי. בכל פעם שהמודל הצליח לענות, העובד נדרש לתקן ולשנות את השאלה עד שהמודל נכשל וטעה. התהליך חזר על עצמו מול שלושה מודלים שונים כדי ליצור רמות קושי מגוונות.

במה הוא שונה ממאגר SQuAD 1.1 הרגיל?

שני המאגרים משתמשים באותם קטעי מקור מוויקיפדיה, אך ב־SQuAD השאלות נכתבו באופן חופשי וטבעי. כאן השאלות נוסחו מראש כדי לשבור מודלים, ולכן הן נוטות להיות הרבה יותר מורכבות, עם מלכודות תחביריות ודרישה להבנה עמוקה יותר. בנוסף, סט הבדיקה כאן לא כולל תשובות ומיועד לבדיקה ב־Dynabench.

האם מותר להשתמש בו לפיתוח מודל מסחרי?

הרישיון הוא CC-BY-SA, שמאפשר שימוש מסחרי אך כולל סעיף שיתוף זהה המחייב להפיץ נגזרות תחת אותו רישיון. קיימת מחלוקת משפטית פתוחה האם משקולות של מודל שאומן על המאגר נחשבות ליצירה נגזרת. אם אתם מפתחים מוצר קנייני סגור, רוב היועצים המשפטיים ימליצו להימנע מאימון ישיר עליו.

איך טוענים

הנתונים מחולקים לקובצי Parquet בתוך המאגר, ללא צורך בהרשאת גישה מיוחדת או אישור מוקדם. הטעינה נעשית ישירות דרך ספריית datasets על ידי ציון המזהה UCLNLP/adversarial_qa. השדות העיקריים שתעבדו מולם הם context, question, ו־answers שמכיל את מיקום התו ותוכן התשובה. נקודה קריטית לעבודה: סט הבדיקה לא כולל תשובות כלל, כי הוא נבנה עבור הגשת תחזיות ללוח התוצאות של Dynabench, ולכן להערכה פנימית עצמאית תצטרכו להסתמך על סט הוולידציה.

from datasets import load_dataset

ds = load_dataset("UCLNLP/adversarial_qa")

הרישיון

המאגר מוגדר במטא-דאטה תחת רישיון CC-BY-SA 4.0, אם כי בכרטיס עצמו נכתב CC-BY-SA 3.0. בשני המקרים מדובר ברישיון שיתוף זהה שמתיר שימוש מסחרי, אך מחייב מתן קרדיט והפצה של יצירות נגזרות תחת אותו רישיון בדיוק. אימון מודל על הנתונים האלה עלול להחיל את דרישת השיתוף על משקלי המודל שתפיצו, ולכן צוות משפטי של חברה מסחרית עלול להערים קשיים על השימוש בו במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗