GPT
W

wmt16

קוד פתוח

wmtunknown2022-03-02

המאגר כולל עשרות מיליוני זוגות משפטים מקבילים לתרגום מכונה מאירועי WMT של 2016. חוקרים ומפתחים נעזרים בו בעיקר כבנצ'מרק סטנדרטי להשוואת ביצועי מודלים מול מאמרי עבר בתחום.

  • 5,460הורדות בחודש
  • 27לייקים

מה זה

הנתונים מחולקים לפי צמדי שפות שמחברים בין אנגלית לשפות אירופיות שונות, כולל צ'כית, גרמנית, פינית, רומנית, רוסית וטורקית. כל רשומה כוללת שדה תרגום עם זוג משפטים מקבילים. המקור של החומרים מגיע מאתר statmt.org, והוא מרכז טקסטים שנאספו עבור תחרות התרגום של אותה שנה, כולל קובצי אימון, ולידציה ובדיקה נפרדים.

הכרטיס עצמו מפרט את הנתונים המדויקים עבור הצמד צ'כית-אנגלית, שבו יש 997,240 משפטי אימון, 2,656 משפטי ולידציה ו־2,999 משפטי בדיקה. שאר הצמדים, כמו גרמנית-אנגלית, מחולקים למספר קובצי אימון נפרדים בפורמט פרקט. מעבר לכך, הכרטיס לא מפרט תהליכי סינון, עיבוד מוקדם או את מקורות התוכן המדויקים של שאר השפות.

מתאים ל

  • בנצ'מרק למודלי תרגום

    השוואת ביצועי מודל תרגום מול תוצאות עבר שפורסמו בספרות המחקרית על נתוני 2016.

  • אימון תרגום לצמדים קיימים

    אימון מודל על צ'כית, גרמנית, רוסית או טורקית מול אנגלית על גבי מיליוני דוגמאות.

  • בדיקת איכות יישור טקסט

    בחינת כלים לסינון רעשים על בסיס הטעויות הידועות בקורפוס של Common Crawl.

איפה זה נופל

יש בעיה רצינית בקובץ של Common Crawl שנכלל כאן. הכרטיס מציין במפורש שקבצים בשפות שאינן אנגלית מכילים משפטים רבים באנגלית, ושהמשפטים המקבילים באנגלית אינם מיושרים וחסרי קשר לטקסט המקביל. המארגנים הודיעו שלא יתקנו את הנתונים הישנים האלה. בנוסף, אין במאגר עברית בכלל, והטקסטים נאספו עד 2016 כך שהשפה עשויה להיות מיושנת.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא, המאגר לא כולל עברית כלל. השפות הזמינות הן צ'כית, גרמנית, אנגלית, פינית, רומנית, רוסית וטורקית בלבד.

האם מותר להשתמש במידע לפרויקט מסחרי?

הרישיון מוגדר כלא ידוע ולכן אין אישור מפורש לשימוש מסחרי. שימוש בחומר כזה לצורך מוצר עלול לחשוף אתכם לתביעות זכויות יוצרים, ולכן עדיף להימנע מכך.

כמה שטח אחסון צריך בשבילו?

נפח הקבצים להורדה עומד על 1.69 גיגהבייט והנפח שנוצר בדיסק הוא 297.28 מגהבייט. בסך הכל נדרשים בערך שני גיגהבייט פנויים כדי לעבוד איתו בצורה מקומית.

מה הבעיה עם איכות התרגומים בחלק מהחומר?

המארגנים מזהירים שהטקסטים שהגיעו מ־Common Crawl סובלים מחוסר יישור חמור בין המשפטים. בנוסף, קבצים שאמורים להיות בשפות זרות מכילים המון משפטים באנגלית במקום שפת היעד.

איך טוענים

טוענים את המאגר דרך Hugging Face בסקריפט פייתון באמצעות בחירת צמד השפות הרצוי והחלקים הדרושים. הקבצים יושבים בפורמט פרקט ואין צורך בבקשת גישה מיוחדת, כך שההורדה מתחילה מיד. נפח ההורדה עומד על 1.69 גיגהבייט והנפח שנוצר בדיסק מגיע ל־297.28 מגהבייט, לצד תמיכה בהזרמה ישירה בלי להוריד את כל המשקל מראש.

from datasets import load_dataset

ds = load_dataset("wmt/wmt16")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין שום ודאות משפטית לגבי מה שמותר לעשות עם המידע, בטח שלא בסביבה מסחרית או באימון מודלים למוצרים פנימיים. אם אתם שוקלים להשתמש בזה מחוץ למחקר אקדמי טהור, אתם לוקחים סיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗