GPT
M

mrqa

קוד פתוח

mrqa-workshopunknown2022-03-02

אוסף של 18 מאגרי שאלות ותשובות באנגלית שעברו האחדה לפורמט חילוץ קטעים אחיד. הוא נבנה במיוחד כדי לבחון הכללה של מודלים מחוץ לדומיין האימון.

  • 3,436הורדות בחודש
  • 24לייקים

מה זה

הנתונים מורכבים משישה מקורות שונים לאימון, שישה לפיתוח ושישה לבדיקה, כולם מבוססים על דאטהסטים מוכרים כמו SQuAD, NewsQA ו־HotpotQA. כל רשומה מכילה שאלה, טקסט רקע באורך של עד 800 טוקנים, ותשובות שחולצו ישירות מתוך הרקע יחד עם מיקומי התווים והטוקנים שלהן. היוצרים הכניסו טוקנים מיוחדים לכותרות, מסמכים ופסקאות, ופירקו את הטקסט בעזרת spaCy.

במבחן הסופי מופיעים דאטהסטים שלא נכללו באימון, ביניהם DROP, BioASQ ו־TextbookQA, מה שמאלץ את המודל להתמודד עם סגנונות כתיבה ונושאים חדשים. כל המשימות עברו המרה למבנה אחיד: אין שאלות ללא מענה, אין שאלות בחירה מרובה, וכל תשובה חייבת להופיע פיזית בתוך הטקסט הנתון.

מתאים ל

  • בדיקת הכללה מחוץ לדומיין

    הערכת מודלי QA על טקסטים רפואיים ומדעיים שלא נראו באימון.

  • אימון מודל חילוץ תשובות

    אימון מערכות הבנת הנקרא על מגוון מקורות בפורמט אחיד.

  • השוואת ביצועים אקדמית

    מדידת F1 והתאמה מדויקת מול תוצאות בנצ'מרק MRQA 2019.

איפה זה נופל

ההגבלה הגדולה ביותר היא שכל הטקסטים נחתכו ל־800 טוקנים ראשונים בלבד, מה שהופך חלק מהמשימות לקלות יותר ומעוות את המבנה המקורי. בנוסף, כל הדוגמאות הן באנגלית בלבד, ואין ייצוג לעברית או לשפות אחרות. העובדה שסילקו שאלות ללא מענה פוגעת ביכולת לבדוק הזיות של מודלים. הכרטיס גם לא מפרט סינון פרטים אישיים, מידע רגיש או ניתוח הטיות חברתיות במקורות המקוריים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

הרישיון הכללי מוגדר כלא ידוע. בנוסף, המאגר הוא איחוד של 18 מקורות שונים עם תנאי שימוש מקוריים משלהם. לא הייתי בונה עליו מוצר מסחרי בלי לבדוק את הרישיונות של כל מקור בנפרד.

האם המאגר כולל עברית?

לא. הנתונים כולם באנגלית בלבד תחת קוד שפה en. אין כאן תמיכה או ייצוג לשפות אחרות.

איך אספו והכינו את הנתונים?

החוקרים לקחו 18 מאגרי שאלות ותשובות קיימים והמירו אותם למבנה של SQuAD. הם חתכו את ההקשר לעד 800 טוקנים, השאירו רק שאלות עם תשובה בגוף הטקסט, ומחקו פורמטים כמו שאלות אמריקאיות.

במה הוא שונה מסתם להוריד את SQuAD?

SQuAD הוא רק מקור אחד מתוך ה־18 שיש כאן. היתרון הוא שחלוקת הבדיקה כוללת מקורות שונים לגמרי מחלוקת האימון, מה שמאפשר לבדוק עמידות אמיתית של מודל כשהוא פוגש סגנון כתיבה זר.

איך טוענים

המאגר מחולק לקובצי Parquet, עם קובץ יחיד לבדיקה ותשעה קבצים לחלק האימון, כך שטוענים אותו ישירות דרך הספרייה הרגילה בלי צורך בהרשאות גישה מיוחדות. שדות המפתח לעבודה הם context לטקסט הרקע, question לשאלה, ו־detected_answers שמכיל את התשובות ואת הטווחים שלהן. לפני הרצה כדאי לשים לב לעיבוד הטקסט: כל המדדים הרשמיים נשענים על נרמול שכולל הסרת סימני פיסוק, אותיות קטנות והשמטת מילות יידוע באנגלית.

from datasets import load_dataset

ds = load_dataset("mrqa-workshop/mrqa")

הרישיון

הרישיון המדווח במאגר הוא unknown. בפועל זה אומר שאף אחד לא הגדיר תנאי שימוש ברורים, ואסור להניח שמותר להשתמש בו לפיתוח מוצרים מסחריים. מודל שתאמנו עליו נשען על 18 מקורות שונים, שלכל אחד מהם עשוי להיות רישיון נפרד לחלוטין, כך ששימוש מעבר למחקר אקדמי דורש בדיקה משפטית של כל מקור בנפרד.

הרישיון המלא ב־Hugging Face ↗