GPT
I

iwslt2017

קוד פתוח

IWSLTcc-by-nc-nd-4.02022-03-02

תרגומי שיחות והרצאות TED בין אנגלית לשפות כמו גרמנית, ערבית וצרפתית. מי שבוחר בו מחפש בנצ'מרק מקובל לתרגום דיבור ותרגום רב-לשוני.

  • 2,279הורדות בחודש
  • 41לייקים

מה זה

המאגר מציע זוגות משפטים מתורגמים שנלקחו מתמלולים ותרגומים של הרצאות TED, עבור תחרות התרגום של IWSLT מ־2017. כל רשומה כוללת מילון תרגום פשוט עם משפט מקור ומשפט יעד בשתי שפות. החלוקה הפנימית מוגדרת לפי צמדי שפות, כאשר כל צמד מציע חלוקה מובנית לסט אימון, סט אימות וסט בדיקה. למשל, בצמדים כמו אנגלית וגרמנית או אנגלית וערבית יש מעל 200,000 משפטי אימון, כמה מאות משפטי אימות, וכשמונת אלפים משפטי בדיקה.

הכרטיס מציין משימה רב-לשונית שמכסה שפות כמו אנגלית, גרמנית, הולנדית, איטלקית ורומנית, לצד משימות תרגום דו-לשוניות הכוללות גם ערבית, צרפתית, יפנית, קוריאנית וסינית. עם זאת, הכרטיס לא מפרט כיצד הטקסטים סוננו, נוקו או אומתו מעבר לעובדה שהם נשענים על תרגומי הרצאות TED. הוא גם משאיר סעיפים רבים ריקים לגבי תהליך העבודה של המתרגמים.

מתאים ל

  • הערכת ביצועי מודלי תרגום

    הרצת בדיקות סטנדרטיות ובנצ'מרק על סטי הבדיקה בצמדי השפות הנתמכים כדי להשוות ביצועים מול פרסומים קודמים.

  • אימון אקדמי לתרגום דיבור

    אימון מערכות תרגום מכונה בסביבת מחקר שמתמקדת בשפת הרצאות מתוזמנת ומוקלטת.

  • ניסויי תרגום zero-shot

    בדיקת יכולות תרגום בין שפות אירופיות שונות המופיעות במאגר ללא אימון ישיר על זוגות השפות הספציפיים.

איפה זה נופל

הנתונים מוגבלים לשפת דיבור של הרצאות TED, מה שאומר שהסגנון אינו מייצג טקסטים טכניים, מסמכים רשמיים או שיחות יומיומיות. עברית אינה קיימת במאגר כלל. הנתונים מתוארכים לשנת 2017 ומטה, כך שהם אינם מכילים מונחים עדכניים. הכרטיס אינו מפרט שום מידע על הטיות אפשריות, בדיקות איכות או הסרת מידע אישי. בנוסף, חלקי האימות קטנים יחסית, עם פחות מתשע מאות דוגמאות בכל צמד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא מסוג לא-מסחרי ואינו מתיר נגזרות, לצד תנאי השימוש של TED Talks. שימוש מסחרי אסור לחלוטין, וכל תוצר מוגבל למחקר בלבד.

האם יש במאגר נתוני תרגום לעברית?

לא, עברית אינה נכללת ברשימת השפות. השפות הזמינות הן ערבית, גרמנית, אנגלית, צרפתית, איטלקית, יפנית, קוריאנית, הולנדית, רומנית וסינית.

כמה מקום בדיסק צריך כדי לעבוד איתו?

ההורדה של כלל הקבצים שוקלת 4.24 גיגה-בייט. העיבוד דורש עוד 1.14 גיגה-בייט, כך שבסך הכל נדרשים 5.38 גיגה-בייט של שטח אחסון במחשב.

מאיפה הנתונים נאספו?

הטקסטים נלקחו מתמלולים ותרגומים של הרצאות TED עבור סדנת IWSLT בשנת 2017. הכרטיס אינו מספק פרטים נוספים על תהליך האיסוף או שיטות הנרמול.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה באמצעות ציון המזהה ובחירת הקונפיגורציה של צמד השפות הרצוי. אין צורך באישור גישה מוקדם או במפתחות מיוחדים. הורדת כלל הקבצים דורשת 4.24 גיגה-בייט, יצירת הנתונים המעובדים תופסת 1.14 גיגה-בייט, ובסך הכל נדרשים 5.38 גיגה-בייט מקום פנוי בדיסק. כל דגימה מחזירה אובייקט עם שדה יחיד בשם translation, שמכיל את הטקסטים בשתי השפות שנבחרו.

from datasets import load_dataset

ds = load_dataset("IWSLT/iwslt2017")

הרישיון

הרישיון המדווח הוא cc-by-nc-nd-4.0 יחד עם תנאי השימוש של TED Talks. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת ייחוס למקור, ואיסור על הפצת יצירות נגזרות. אימון מודל על הנתונים הללו פוסל אותו משימוש במוצר מסחרי ומגביל את העבודה לצורכי מחקר והערכה בלבד.

הרישיון המלא ב־Hugging Face ↗