GPT
X

xquad

קוד פתוח

googlecc-by-sa-4.02022-03-02

תרגום מקצועי ומקבילי של מבחן שאלות ותשובות מוכר לתוך עשר שפות שונות. מי שרוצה לבדוק יכולות הבנת הנקרא חוצות שפות מקבל כאן נקודת השוואה ישירה ואחידה.

  • 16,169הורדות בחודש
  • 42לייקים

מה זה

המאגר מבוסס על תת קבוצה מתוך סט הפיתוח של SQuAD v1.1. הוא כולל בדיוק 240 פסקאות ו 1,190 צמדים של שאלות ותשובות באנגלית, שתורגמו בידי מתרגמים מקצועיים לעשר שפות נוספות: ספרדית, גרמנית, יוונית, רוסית, טורקית, ערבית, וייטנאמית, תאילנדית, סינית והינדי. המבנה מקבילי לחלוטין בכל השפות, כך שכל שאלה ופסקה קיימות באותו מזהה במדויק בכל גרסה.

כל רשומה בנויה ממזהה טקסטואלי, פסקת מקור, שאלה, ומילון תשובות שמכיל את מחרוזת התשובה עצמה ומיקום התו המדויק שבו היא מתחילה בתוך הפסקה. המאגר אינו מחולק לאימון ומבחן. יש בו רק פיצול ולידציה יחיד של 1,190 שורות לכל שפה נתמכת.

מתאים ל

  • בנצ׳מרק הבנת הנקרא

    מדידת ביצועים של מודלי שפה בשאלות ותשובות מבוססות הקשר ב 11 שפות שונות.

  • בדיקת העברה בין שפות

    בחינה האם מודל שאומן על אנגלית בלבד מצליח לענות על אותן שאלות בערבית או בגרמנית.

  • השוואת מודלים רב לשוניים

    הרצת אותו מבחן בדיוק על מספר מודלים כדי להשוות ביצועים על בסיס נתונים זהה ומקבילי.

איפה זה נופל

זהו אינו מאגר לאימון. עם 1,190 דוגמאות בלבד לכל שפה ופיצול ולידציה בלבד, הוא מיועד להערכה בלבד. בנוסף, עברית נעדרת לחלוטין מהרשימה. הטקסטים מגיעים במקור מוויקיפדיה באנגלית של שנת 2016 ותורגמו לשפות היעד, מה שיוצר סגנון תרגומי ולא טקסט שנכתב במקור בידי דוברי השפה. מעבר לכך, כרטיס המאגר משאיר שדות רבים ריקים ולא מפרט מידע על הטיות, אופן בקרת האיכות של המתרגמים, או טיפול במידע אישי.

שאלות
נפוצות

האם הדאטהסט מתאים לאימון מודל?

לא. המאגר כולל 1,190 שאלות בלבד לכל שפה ומוגדר כפיצול ולידציה בלבד. המטרה שלו היא הערכת ביצועים ולא אימון מודלים מאפס.

האם יש במאגר תמיכה בעברית?

לא. מתוך 11 השפות שנכללות במאגר, עברית לא קיימת. מבין שפות האזור ישנה תמיכה בערבית בלבד.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא cc-by-sa-4.0 ומתיר שימוש מסחרי, אך כולל דרישת שיתוף זהה. אם תפיצו גרסה ערוכה של הנתונים, תצטרכו לשחרר אותה תחת אותו רישיון.

כמה מקום המאגר דורש במחשב?

הקבצים להורדה שוקלים יחד 146.31 מגה בייט. לאחר פריסה ויצירת הנתונים המלאה נדרש שטח דיסק כולל של 165.28 מגה בייט בלבד.

איך טוענים

הקבצים שמורים בפורמט פרקט ואין צורך לבקש אישור גישה מיוחד כדי להוריד אותם. כלל הקבצים שוקלים כ 146 מגה בייט להורדה ותופסים סביב 165 מגה בייט בדיסק לאחר פריסה מלאה. אפשר לטעון קונפיגורציה של שפה ספציפית לפי קוד השפה. שדות המפתח שחובה למפות הם הטקסט המלא, השאלה, ומערך התשובות שכולל את מיקום ההתחלה, שכן חישוב המדדים המקובל מסתמך על חיתוך מדויק של המחרוזת מתוך הפסקה.

from datasets import load_dataset

ds = load_dataset("google/xquad")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי, אך דורש מתן קרדיט הולם ושיתוף זהה. המשמעות היא שאם אתם משנים את הנתונים, מעבדים אותם או יוצרים מהם נגזרת, אתם מחויבים להפיץ את התוצר תחת אותו הרישיון בדיוק. מודלים שרק מאומנים או נבדקים עליו צריכים לבחון היטב את תנאי השיתוף הזהה לפני שילוב במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗