GPT
S

swag

קוד פתוח

allenaiunknown2022-03-02

המאגר מכיל שאלות אמריקאיות להסקה על מצבים יומיומיים מתוך כתוביות של סרטונים. הוא נבנה עם מסיחים שנועדו להכשיל מודלים כדי לבדוק הבנה פיזית אמיתית.

  • 119,625הורדות בחודש
  • 24לייקים

מה זה

הנתונים מבוססים על 113 אלף שאלות רב ברירה שמציגות תיאור מצב ומבקשות לבחור מה יקרה הלאה מתוך ארבע אפשרויות. הטקסטים נלקחו מכתוביות של סרטוני יוטיוב מתוך ActivityNet Captions שמתמקדים בפעולות מוגדרות, ומתיאורי סרטים ותסריטים ממאגר LSMDC. הסיווג מכיל 73 אלף דוגמאות אימון, 20 אלף דוגמאות אימות ו־20 אלף דוגמאות מבחן עיוורות ששמורות ללוח התוצאות.

כל רשומה מציגה משפט פתיחה, התחלה של המשפט הבא, וארבע סיומות אפשריות שמתוכן רק אחת נכונה. התשובה הנכונה היא התיאור האמיתי של המשך הסרטון. שלוש האפשרויות השגויות נוצרו על ידי מחשב באמצעות סינון יריבי במטרה למנוע ממודלים להסתמך על רמזים סגנוניים או אורך הטקסט, ולאחר מכן עברו אימות וסינון ידני של בודקים אנושיים בתשלום.

במאגר קיימות שתי תצורות עיקריות בקבצי Parquet. תצורת regular מיועדת לאימון והערכה של מודלים, ותצורת full כוללת שדות נוספים שמתעדים את תהליך איסוף הנתונים והמקור של כל סיומת.

מתאים ל

  • בנצ'מרק להסקה פיזית

    בדיקת יכולת המודל לחזות המשך הגיוני של פעולות בעולם האמיתי מתוך ארבע אפשרויות קיימות.

  • אימון מודל שאלות אמריקאיות

    כוונון עדין של מודלי שפה לסיווג טקסט ובחירת התשובה הנכונה מתוך מסיחים שמבלבלים מכונות.

  • מחקר על עמידות מסיחים

    ניתוח האופן שבו מודלים מתמודדים עם דוגמאות יריביות שנוצרו במיוחד כדי למנוע היוריסטיקות שטחיות.

איפה זה נופל

כל הטקסט במאגר כתוב באנגלית בלבד ואינו כולל שפות אחרות, כך שהוא אינו מתאים לבדיקת יכולות בעברית. המקורות מוגבלים לכתוביות של סרטים וסרטוני יוטיוב, ולכן השפה מוגבלת לתיאור פעולות חזותיות יומיומיות. כרטיס המאגר מציין כי חסר מידע לגבי הטיות חברתיות, פרטיות או הגבלות נוספות, ומאגר המבחן עיוור לחלוטין ולכן אינו מאפשר בדיקת טעויות מקומית ללא הגשה ללוח המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא unknown ולכן אין היתר ברור לשימוש מסחרי. הנתונים נלקחו מפרויקטים חיצוניים של סרטוני יוטיוב וסרטים מסחריים, כך שלשימוש במוצר בפועל מומלץ לפנות ישירות ליוצרים או לבדוק את תנאי המקורות המקוריים.

האם הדאטהסט כולל תמיכה בעברית?

לא. המאגר מוגדר בקוד en ומכיל טקסטים באנגלית בלבד שמקורם בכתוביות ותסריטים. עבור בדיקות בעברית תצטרכו לתרגם את הנתונים באופן עצמאי.

איך נוצרו התשובות השגויות בכל שאלה?

החוקרים ייצרו אפשרויות בעזרת מחשב והשתמשו בשיטת Adversarial Filtering כדי לבחור סיומות שמטעות מודלים אך נשמעות הגיוניות מבחינה סטטיסטית. לאחר מכן בודקים אנושיים בתשלום עברו על הנתונים כדי לוודא שאדם רגיל יכול לזהות את התשובה הנכונה בקלות.

האם קובץ המבחן מכיל תוויות נכונות לבדיקה עצמית?

לא. 20 אלף הדוגמאות של פיצול המבחן הן עיוורות ומיועדות במקור להגשה ישירה ללוח התוצאות הרשמי. להערכה מקומית עצמאית של המודל שלכם תצטרכו להשתמש בפיצול האימות שמכיל 20 אלף דוגמאות עם תוויות מלאות.

איך טוענים

הנתונים מחולקים לשבעה קבצי Parquet ישירים וזמינים להורדה חופשית ללא צורך בהרשמה מיוחדת או אישור גישה מראש. לצורך אימון והערכה שוטפים טוענים את קבצי תצורת regular. השדות העיקריים שמעניינים אתכם הם sent1 ו־sent2 שמרכיבים את ההקשר, ארבעת השדות ending0 עד ending3 שמכילים את הסיומות לבחירה, ושדה label שמציין את האינדקס של התשובה הנכונה.

from datasets import load_dataset

ds = load_dataset("allenai/swag")

הרישיון

הרישיון המוגדר במאגר הוא unknown. המשמעות היא שאין תנאי שימוש מוגדרים או הרשאה רשמית לשימוש מסחרי בקבצים, ולא ברור אם מותר לשלב מודל שאומן עליהם במוצר מסחרי. לפני שמשלבים את המידע בפרויקט שאינו מחקרי, חייבים לבדוק את הרישיונות של מקורות הנתונים המקוריים ActivityNet ו־LSMDC או לפנות ליוצרי המאגר.

הרישיון המלא ב־Hugging Face ↗