GPT
W

wmt24pp

קוד פתוח

googleapache-2.02025-02-06

מאגר תרגום מכונה של גוגל מאנגלית ל־55 שפות ודיאלקטים, שכולל תרגום אנושי ועריכה אנושית. הוא נועד בעיקר לבדיקת איכות של מודלי שפה בתרגום על טקסטים מכמה תחומים שונים.

  • 13,293הורדות בחודש
  • 93לייקים

מה זה

גוגל שחררו כאן נתונים עבור 55 צמדי שפות מאנגלית לשפות יעד שונות, כולל ניואנסים של דיאלקטים כמו ערבית מצרית לעומת סעודית. הרשומות מגיעות מחמישה תחומים מוגדרים: חדשות, רשתות חברתיות, דיבור, ספרות ותחום בשם canary. בכל שפה הנתונים כוללים טקסט מקור באנגלית, תרגום ייחוס מקורי, ותרגום שעבר עריכה אנושית נוספת כדי לשפר את הדיוק.

המבנה הפנימי נשען על קובצי jsonl נפרדים לכל צמד שפות. כל שורה מייצגת מקטע טקסט עם מזהה מסמך ומזהה מקטע ייחודי. החוקרים סימנו מראש מקטעים באיכות נמוכה בעזרת דגל ייעודי, וממליצים להוריד אותם כדי לא לפגוע בהערכות שלכם.

מתאים ל

  • בנצ'מרק למודלי תרגום

    בדיקת איכות מודלים מול תרגום אנושי שעבר עריכה ב־55 שפות ודיאלקטים.

  • אימון על עריכה אנושית

    למידה מהפער שבין התרגום המקורי לתרגום הערוך לצורך שיפור פלט.

  • בדיקת ביצועים לפי תחום

    מדידת יכולת המודל בספרות, דיבור או רשתות חברתיות בנפרד.

איפה זה נופל

המאגר מתרגם רק מאנגלית לשפות אחרות, אין כאן תרגום בכיוון ההפוך. בנוסף, עברית בכלל לא מופיעה ברשימת השפות הזמינות, מה שהופך אותו ללא רלוונטי למי שבונה מוצר מקומי לשוק הישראלי. הטקסטים מכילים מקטעים עם רעש שמחייבים סינון ידני לפי הדגל שהחוקרים הגדירו, ואם לא תנקו אותם תקבלו תוצאות בדיקה מוטות.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר כולל 55 שפות ודיאלקטים כמו ערבית, גרמנית, בולגרית וספרדית, אבל עברית אינה נכללת ברשימה.

האם מותר להשתמש בנתונים לפרויקט מסחרי?

כן, המאגר מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, כל עוד שומרים על תנאי הייחוס ומצרפים את הרישיון המקורי.

איזה תרגום מומלץ לקחת כבסיס להשוואה?

עדיף להשתמש בשדה target ולא ב־original_target. השדה target מייצג עריכה אנושית שנעשתה על התרגום המקורי, והחוקרים ממליצים עליו כטקסט הייחוס הראשי.

איך להיפטר מרשומות פגומות או משובשות?

החוקרים כללו בכל שורה שדה בוליאני בשם is_bad_source. כל שורה שמוגדרת כ־true מכילה לכלוך כמו HTML או קישורים, וכדאי לסנן אותה לפני שמתחילים לעבוד.

איך טוענים

אין כאן צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face. כל צמד שפות יושב בקובץ jsonl עצמאי משלו, למשל en-de_DE.jsonl. בעבודה איתו, סננו החוצה כל שורה שבה השדה is_bad_source מסומן כחיובי, כי היא מכילה שאריות כמו HTML, קישורים או אימוג'ים. לצורך הערכה של מודלים, החוקרים ממליצים להשתמש בערך של target, שהוא התרגום שעבר עריכה, במקום בשדה original_target.

from datasets import load_dataset

ds = load_dataset("google/wmt24pp")

הרישיון

המאגר שוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע ושילוב שלו במוצרים, בתנאי שנותנים ייחוס מתאים לגוגל ולחוקרים ומצרפים את נוסח הרישיון. מודל שתאמנו או תבדקו עליו לא כפוף למגבלות של הדבקת קוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗