GPT
X

xwinograd

קוד פתוח

Muennighoffcc-by-4.02022-07-17

מבחן וינוגרד רב לשוני שנועד לבדוק יכולות הסקת היגיון במודלים בשש שפות שונות. אם אתם בוחנים ביצועים חוצי שפות במשימות הבנה בסיסיות, המאגר הזה מרכז נתונים שקשה למצוא מחוץ לאנגלית.

  • 6,137הורדות בחודש
  • 17לייקים

מה זה

המאגר מבוסס על סכמות וינוגרד לבדיקת היגיון בריא והבנת כינויי גוף, כפי ששימשו במחקר על הכללה בין לשונית. הוא מאחד שאלות וינוגרד ממחקר קודם של טיכונוב ושותפיו, יחד עם תוספת ייעודית עבור השפה הסינית.

בסינית היו במקור רק 16 דוגמאות, ולכן המחברים הוסיפו 488 דוגמאות נוספות שמקורן במאגר clue/cluewsc2020. שאר השפות נלקחו ישירות מהעבודה המקורית, והנתונים מחולקים לפי שפות לבדיקה ישירה של יכולות המודל.

הפיזור בין השפות לא אחיד בכלל. אנגלית כוללת 2,325 דוגמאות ויפנית מגיעה עם 959, בזמן שבצרפתית יש 83 דוגמאות בלבד, בפורטוגזית 263, ברוסית 315 ובסינית 504.

מתאים ל

  • הערכת היגיון רב לשוני

    בדיקת יכולת המודל להבין הקשרים מורכבים וכינויי גוף בשש שפות שונות במבחן השוואתי אחיד.

  • מבחן ביצועים למודלים

    הרצת בדיקות סופיות על נתוני טסט מוכנים בלי צורך בחלוקה ידנית של קבצי המקור.

  • בדיקת העברה בין שפות

    מדידת יכולת המודל להשליך ידע שנלמד בשפה אחת, לרוב אנגלית, על שפות יעד אחרות.

איפה זה נופל

הבעיה המרכזית היא חוסר האיזון הקיצוני בכמויות. הערכה של צרפתית על בסיס 83 דוגמאות בלבד לא תיתן לכם תמונה מייצגת או מובהקת סטטיסטית. בנוסף, עברית לא קיימת כאן בכלל, כך שלבדיקות מקומיות המאגר חסר תועלת. הדאטהסט בנוי כמבחן ביצועים ומכיל רק חלוקת טסט, כך שאי אפשר להשתמש בו לאימון מודלים מאפס אלא רק להערכה סופית. יש גם לקחת בחשבון שהסינית מורכבת משני מקורות נפרדים, מה שעשוי לדרוש סינון ידני אם מחפשים עקביות מלאה מול המאגר המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא ללא הגבלה. עליכם רק לציין את המקור ולתת קרדיט למחברים בהתאם לתנאי הרישיון. זה תקף גם להערכת מודלים מסחריים וגם לשילוב הנתונים במערכות פנימיות.

האם הדאטהסט כולל שאלות בעברית?

לא, אין במאגר עברית בכלל. השפות הזמינות הן אנגלית, צרפתית, יפנית, פורטוגזית, רוסית וסינית בלבד. אם אתם מחפשים מבחן וינוגרד בעברית, תצטרכו לפנות למאגרים אחרים או לתרגם נתונים באופן עצמאי.

כמה שוקל הדאטהסט ואיך הוא בנוי טכנית?

המאגר קל משקל וכולל שמונה קבצים בלבד, רובם קבצי parquet זעירים שמכילים סך הכל כמה אלפי דוגמאות בודדות. כל שפה יושבת בתיקייה משלה עם קובץ מבחן יחיד, ללא סטים נפרדים של אימון או ולידציה. הטעינה מתבצעת ישירות לזיכרון העבודה בלי לתפוס נפח אחסון מורגש.

מאיפה הגיעו הדוגמאות בסינית?

במאגר המקורי של טיכונוב היו רק 16 דוגמאות בסינית, כמות שלא אפשרה שום בדיקה מעשית. כדי לפתור את זה, המחברים הוסיפו 488 דוגמאות מתוך הפרויקט clue/cluewsc2020. הקוד בכרטיס מאפשר לחתוך רק את 16 הדוגמאות המקוריות אם אתם צריכים שחזור מדויק של המחקר הקודם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים של האגינג פייס לפי קוד השפה המבוקש. אין כאן תהליך אישור גישה מוקדם והקבצים פתוחים להורדה מיידית. הקבצים יושבים בפורמט parquet לפי תיקיות שפה נפרדות, כאשר כל שפה מכילה קובץ טסט יחיד. הנפח הכללי קטן מאוד ומכיל כמה אלפי רשומות בסך הכל, כך שהטעינה לזיכרון מתבצעת בשניות ספורות.

from datasets import load_dataset

ds = load_dataset("Muennighoff/xwinograd")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הנתונים ושילוב שלהם במערכות אחרות. הדרישה החוקית היחידה היא מתן קרדיט מתאים ליוצרים המקוריים ולמחקרים שעליהם המאגר מתבסס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗