GPT
W

wmt19

קוד פתוח

wmtunknown2022-03-02

מאגר ענק של עשרות מיליוני משפטים מקבילים לתרגום מכונה מבוסס תחרות WMT19. הוא שימושי בעיקר למי שמאמן או בוחן מודלים על צמדי שפות אירופיות ואסיאתיות מול אנגלית.

  • 9,384הורדות בחודש
  • 48לייקים

מה זה

המאגר כולל בין עשרה למאה מיליון רשומות שמיועדות לאימון מודלי תרגום. הנתונים מחולקים לפי צמדי שפות, כמו צ'כית לאנגלית או גרמנית לאנגלית, ומכילים שפות כמו צ'כית, גרמנית, אנגלית, פינית, צרפתית, גוג'ראטית, קזחית, ליטאית, רוסית וסינית. כל רשומה כוללת שדה תרגום עם הטקסט המקביל בין שתי השפות הרלוונטיות.

המקור מגיע מאתר statmt.org כחלק ממשימת תרגום החדשות של כנס WMT לשנת 2019. הכרטיס לא מפרט תהליכי סינון מדויקים או נרמול, אך מציין חלוקות ברורות לאימון וולידציה. לדוגמה, בצמד צ'כית ואנגלית יש מעל 7.2 מיליון משפטים לאימון ו־2,983 משפטי בדיקה.

מתאים ל

  • אימון מודלי תרגום

    אימון מודלים על צמדי שפות כמו גרמנית לאנגלית או צ'כית לאנגלית עם מיליוני דוגמאות.

  • הערכת ביצועי תרגום

    בדיקת איכות של מודלים קיימים מול סטים מוכנים של ולידציה כמו סט הבדיקה הצ'כי.

  • מחקר אקדמי השוואתי

    בחינת ארכיטקטורות תרגום חדשות מול תוצאות עבר שנמדדו במסגרת תחרות WMT19.

איפה זה נופל

יש בעיה מתועדת וקריטית באיכות הנתונים שמגיעים ממאגר Common Crawl. קבצים שאמורים להכיל שפות שאינן אנגלית כוללים בפועל משפטים רבים באנגלית, ומשפטים מקבילים רבים כלל אינם תואמים זה לזה. מארגני התחרות הודיעו שלא יתקנו את המקור הזה, כי הוא נחשב מיושן והוחלף במאגרים חדשים יותר. בנוסף, חסר כאן כל מידע על הטיות, סינון פרטים מזהים או בדיקות רגישות, והכרטיס כמעט ריק בפרטים האלה.

שאלות
נפוצות

האם יש במאגר עברית?

לא. המאגר מכיל רק צ'כית, גרמנית, אנגלית, פינית, צרפתית, גוג'ראטית, קזחית, ליטאית, רוסית וסינית. עברית כלל לא נכללת בו.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון מדווח כלא ידוע, ולכן אין אישור מפורש לשימוש מסחרי. שימוש כזה כרוך בסיכון משפטי ויש לבדוק את התנאים באתר התחרות המקורי.

כמה מקום בדיסק צריך בשבילו?

נפח ההורדה של הקבצים עומד על 2.02 גיגה בייט, והנתונים המעובדים דורשים עוד 1.32 גיגה בייט. בסך הכל תצטרכו לפחות 3.33 גיגה בייט פנויים בדיסק.

האם הנתונים נקיים ומוכנים לאימון מידי?

לא לגמרי. חלק מהנתונים שנלקחו ממאגר Common Crawl סובלים מחוסר התאמה חמור בין משפטים מקבילים וערבוב של אנגלית בטקסטים הזרים, כך שחובה להפעיל סינון עצמאי.

איך טוענים

הקבצים שמורים בפורמט Parquet בחלוקה לפי שפות, ללא צורך באישור גישה מיוחד. אפשר לטעון אותו ישירות או לבנות תת קבוצה מותאמת עם סקריפטים ייעודיים להגדרת צמד השפות והמקורות. נפח ההורדה עומד על 2.02 גיגה בייט, והנתונים שנוצרים תופסים כ־1.32 גיגה בייט, כך שנדרשים בסך הכל כ־3.33 גיגה בייט בדיסק. השדה העיקרי שמעניין אתכם בקוד הוא translation שמכיל את צמד המחרוזות.

from datasets import load_dataset

ds = load_dataset("wmt/wmt19")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין היתר ברור לשימוש מסחרי, לא ידוע אם מותר לשלב את הנתונים במוצר סגור, ואי אפשר לדעת אילו זכויות יוצרים חלות על מודל שתאמנו עליו. עבור גוף עסקי, מדובר בסיכון משפטי שמחייב בדיקה מול מקורות המידע המקוריים באתר statmt.org לפני שנוגעים בחומר.

הרישיון המלא ב־Hugging Face ↗