GPT
W

wmt14

קוד פתוח

wmtunknown2022-03-02

מאגר ותיק לאימון מודלי תרגום מכונה עם עשרות מיליוני זוגות משפטים. משתמשים בו בעיקר כבנצ'מרק סטנדרטי להשוואת ביצועים מול מאמרים קודמים בתחום.

  • 7,706הורדות בחודש
  • 35לייקים

מה זה

המאגר מבוסס על נתוני סדנת התרגום WMT משנת 2014, ומכיל בין 10 ל־100 מיליון רשומות המחולקות לפי צמדי שפות. כל רשומה כוללת מבנה פשוט של שדה תרגום עם שני משפטים מקבילים, למשל בצמד הצ'כי-אנגלי שבו יש מעל 950 אלף דוגמאות אימון, 3,000 משפטי ולידציה ו־3,003 משפטי מבחן.

הטקסטים נאספו ממקורות רשת שונים דרך statmt.org, כולל סריקות רשת של Common Crawl. הכרטיס לא מפרט תהליכי סינון מוקדמים, אך מפנה לאזהרה חמורה לגבי איכות הנתונים שמגיעים מחלק מהמקורות הללו, ללא פעולות ניקוי נוספות מצד המפרסמים.

מתאים ל

  • בנצ'מרק למודלי תרגום

    השוואת ביצועי מודל תרגום מול תוצאות שפורסמו במאמרים קודמים בספרות המחקרית.

  • אימון צמדי שפות נבחרים

    אימון מערכות תרגום לשפות ספציפיות כמו צרפתית-אנגלית או צ'כית-אנגלית.

  • מחקר על דאטה רועש

    בדיקת עמידות של מודלים לאי-דיוקים ולחוסר התאמה בין משפטים מקבילים.

איפה זה נופל

הבעיה המרכזית כאן היא איכות יישור הטקסטים שמקורם ב־Common Crawl. המפרסמים מזהירים שקבצים שאינם באנגלית כוללים המון משפטים באנגלית, וההתאמה בין המשפטים המקבילים פשוט שגויה. מארגני WMT הודיעו שלא יתקנו את זה כי המאגר הוחלף במאגרים חדשים יותר. בנוסף, הנתונים משנת 2014 ולא כוללים עברית כלל, אלא רק צ'כית, גרמנית, אנגלית, צרפתית, הינדי ורוסית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מסומן כלא ידוע, ולכן אין אישור רשמי לשימוש מסחרי. חברות שרוצות להימנע מסיכונים משפטיים יעדיפו לא לאמן עליו מודלים מסחריים. מומלץ לחפש חלופות עדכניות עם רישיון מוגדר וברור.

האם המאגר כולל תרגום לעברית?

לא, אין פה עברית בכלל. השפות הזמינות הן אנגלית, צ'כית, גרמנית, צרפתית, הינדי ורוסית בלבד. מי שמחפש לתרגם מעברית או אליה יצטרך לחפש מאגרים אחרים.

כמה שטח אחסון צריך כדי לעבוד איתו?

עבור צמד שפות בודד כמו צ'כית-אנגלית, קבצי ההורדה שוקלים 1.70 ג'יגה-בייט. לאחר הפריקה והעיבוד נדרשים כ־283 מגה-בייט נוספים. בסך הכל כדאי לשריין לפחות שני ג'יגה-בייט פנויים בדיסק לצמד הזה.

למה מזהירים מפני שימוש בנתוני Common Crawl?

הכרטיס מציין במפורש שחלק מקבצי השפות מכילים טקסטים באנגלית במקום שפת היעד. גרוע מכך, משפטים רבים אינם תרגום ישיר של מקביליהם ומציגים חוסר התאמה מוחלט. המארגנים עצמם ממליצים להשתמש במאגרים חדשים יותר כמו ParaCrawl במקום להסתמך עליהם.

איך טוענים

הנתונים מחולקים ל־48 קבצי Parquet לפי צמדי שפות, כמו de-en או cs-en, מפוצלים מראש לאימון, אימות ובדיקה. כדי לעבוד איתו טוענים את צמד השפות הרצוי בעזרת הסקריפטים הייעודיים של wmt, בלי צורך באישור גישה מיוחד. ההורדה המלאה של קבצי המקור דורשת 1.70 ג'יגה-בייט ונפרסת לכ־283 מגה-בייט על הדיסק עבור צמד בודד, כך שמומלץ לוודא שיש לפחות שני ג'יגה-בייט פנויים לפני שמתחילים.

from datasets import load_dataset

ds = load_dataset("wmt/wmt14")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין היתר מפורש לשימוש מסחרי או לאימון מודלים שמיועדים למוצר, וההשלכות המשפטיות נשארות עליכם. כל עוד אין רישיון ברור, בטוח להשתמש בזה רק למחקר אקדמי ולבדיקות פנימיות.

הרישיון המלא ב־Hugging Face ↗