GPT
X

xcopa

קוד פתוח

cambridgeltlcc-by-4.02022-03-02

תרגום של מבחן COPA האמריקאי ל־11 שפות שונות לבדיקת היסק סיבתי. חוקרים ומפתחים משתמשים בו כדי לבדוק איך מודל שפה מתמודד עם היגיון יומיומי מחוץ לאנגלית.

  • 28,652הורדות בחודש
  • 22לייקים

מה זה

המאגר מבוסס על COPA המקורי משנת 2011, שעבר תרגום ותיוג מחדש כדי להעריך יכולת היסק סיבתי בשפות שונות. כל רשומה מציגה הנחת יסוד קצרה, שאלה שמכוונת לגורם או לתוצאה, ושתי אפשרויות בחירה שמתוכן צריך לסמן את התשובה ההגיונית. השדות כוללים את הטקסטים, המזהה, השאלה, התשובה הנכונה, ודגל שמציין האם נעשה שינוי לעומת המקור.

הנתונים מחולקים ל־11 שפות ממשפחות שונות, ובהן איטלקית, אינדונזית, סינית, אסטונית ותאילנדית. החלוקה הפנימית בכל שפה כוללת סט אימות של 100 דוגמאות וסט מבחן של 500 דוגמאות, ללא סט אימון ייעודי.

מתאים ל

  • הערכת היסק סיבתי

    בדיקה אם מודל רב לשוני מבין קשרי סיבה ותוצאה בהיגיון יומיומי.

  • מבחן ביצועים לשפות מגוונות

    השוואת דיוק המודל בשפות ספציפיות מול תוצאות הבסיס במאמר.

  • מדידת העברה בין שפות

    בדיקת היכולת של מודל שאומן באנגלית לתפקד בשפות אחרות ללא אימון נוסף.

איפה זה נופל

הכרטיס לא כולל דאטה לאימון אלא רק סטים קטנים לבדיקה ולהערכה, כך שהוא לא מתאים לאימון מודל מאפס. אין כאן עברית כלל, אלא רשימה סגורה של שפות שנבחרו למחקר. בנוסף, מדובר בתרגום של מבחן שנכתב במקור באנגלית ב־2011, מה שעלול להכניס הטיות תרבותיות מערביות שלא תמיד תואמות לכל שפה ויעד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא CC BY 4.0 שמתיר שימוש מסחרי חופשי. התנאי המרכזי הוא מתן קרדיט ברור למחברים וציון אם בוצעו שינויים בדאטה. המודלים שמפותחים על בסיסו אינם מחויבים ברישיון פתוח.

האם יש במאגר נתונים בעברית?

לא, המאגר מכסה רק 11 שפות ספציפיות כמו אינדונזית, איטלקית, סינית, קצ'ואה ותאילנדית. עברית אינה נכללת ברשימה הזו. לבדיקת עברית תצטרכו לחפש מקור אחר או לתרגם את המבחן המקורי.

כמה שטח אחסון הדאטהסט דורש?

קבצי ההורדה שוקלים בסך הכל כ־4.08 מגה בייט. לאחר פריסה ועיבוד המאגר תופס סביב 5.1 מגה בייט על הדיסק. מדובר בגודל זעיר שנטען במהירות בכל סביבת פיתוח.

האם אפשר לאמן מודל ישירות על הנתונים האלה?

המאגר מיועד לבדיקה ולא מכיל סט אימון, אלא 100 דוגמאות אימות ו־500 דוגמאות מבחן לכל שפה. בדרך כלל מאמנים את המודל על COPA המקורי באנגלית ובודקים את הביצועים בשפות האחרות. מי שרוצה לאמן בשפות היעד יצטרך מקור נתונים נוסף.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים לפי קוד השפה המבוקש. הקבצים שמורים בפורמט Parquet, אין צורך בבקשת גישה מיוחדת או באישור, וכל ההורדה שוקלת כ־4.08 מגה בייט. השדות העיקריים שצריך לעבד הם premise, שתי האפשרויות choice1 ו־choice2, סוג השאלה בשדה question, והתווית המספרית בשדה label.

from datasets import load_dataset

ds = load_dataset("cambridgeltl/xcopa")

הרישיון

הרישיון הוא CC BY 4.0. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, לשנות אותם ולשלב אותם במערכות אחרות, כל עוד נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי אימון באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗