GPT
E

europarl

קוד פתוח

Helsinki-NLPunknown2022-03-02

מאגר מקבילי רחב היקף המכיל תרגומים ישירים בין עשרות שפות אירופיות מתוך דיוני הפרלמנט האירופי. מתאים למי שבונה או בודק מודלי תרגום מכונה לטקסטים רשמיים ומשפטיים.

  • 7,594הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל מיליוני משפטים מתורגמים שנאספו ישירות מתוך הפרוטוקולים והדיונים של הפרלמנט האירופי. הנתונים מאורגנים כזוגות שפות מקבילים, כאשר כל שורת מידע מכילה מבנה תרגום פשוט עם שפת המקור ושפת היעד. הטקסטים מייצגים שפה פרלמנטרית, דיפלומטית, חוקתית ומנהלתית ברמת ניסוח גבוהה מאוד.

הכרטיס מציג מגוון רחב של תצורות לפי צמדי שפות, ביניהן אנגלית, גרמנית, צרפתית, יוונית, בולגרית, צ'כית ושפות רשמיות נוספות של האיחוד האירופי. מבחינת חלוקה פנימית, כל תצורה מגיעה עם פיצול אימון בלבד, ללא חלוקה מובנית לערכות בדיקה או ולידציה. היקף הרשומות משתנה מאוד בין שפה לשפה, ונע בין מאות אלפי משפטים בצמדים פחות נפוצים לכמעט שני מיליון משפטים בצמדים מרכזיים.

מתאים ל

  • אימון מודלי תרגום

    אימון מערכות תרגום מכונה דו כיווניות עבור צמדי שפות אירופיות.

  • תרגום טקסטים משפטיים

    התאמת מודלים לניסוחים רשמיים, מסמכי מדיניות ופרוטוקולים בירוקרטיים.

  • הערכת איכות תרגום

    בניית מדדי ביצוע והשוואת מודלים על בסיס טקסטים מקבילים מקצועיים.

איפה זה נופל

הטקסטים מגיעים מנאומים והחלטות של מוסד פוליטי, ולכן המשלב הלשוני נוקשה, בירוקרטי ורשמי. אם המטרה שלכם היא לתרגם שיחות יומיומיות, רשתות חברתיות או שפת רחוב, המודל יישמע רובוטי ולא טבעי. חסרה כאן עברית לחלוטין, מה שהופך את המאגר ללא רלוונטי לפיתוח ישיר עבור השוק המקומי בישראל. בנוסף, חסרים פיצולים מובנים להערכה ולבדיקה, כך שתצטרכו לחתוך בעצמכם סטים נקיים כדי להימנע מדליפת מידע בין אימון למבחן.

שאלות
נפוצות

האם המאגר כולל תרגום לעברית?

לא. המאגר מכיל אך ורק שפות רשמיות של האיחוד האירופי, ועברית אינה חלק מהן. מי שמפתח מודל תרגום לעברית יצטרך לחפש מקורות נתונים אחרים.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון המוגדר במאגר הוא unknown, ולכן אין היתר שימוש מסחרי מפורש. מומלץ לבדוק את תנאי המקור של פרויקט OPUS ופרוטוקולי האיחוד האירופי לפני שמשלבים אותו בצנרת מסחרית.

כמה נפח דורשת הורדת הנתונים?

אין צורך להוריד את כל המאגר בבת אחת אלא רק את צמד השפות שמעניין אתכם. כל צמד שפות שוקל להורדה בין 70 ל־380 מגה בייט, כך שמדובר בנפח קל מאוד לטעינה.

האם יש חלוקה מסודרת לקבוצות אימון ובדיקה?

לא. המאגר מגיע עם פיצול יחיד של נתוני אימון עבור כל שפה. תצטרכו להפריד בעצמכם חלק מהנתונים לטובת בדיקה ומבחן כדי לבצע הערכה מהימנה.

איך טוענים

טוענים את המאגר דרך ספריית datasets באמצעות ציון המזהה של Helsinki-NLP והגדרה ספציפית של צמד השפות המבוקש. אין צורך באישור גישה או בהרשמה מוקדמת, והמאגר פתוח להורדה ישירה. הנתונים מאוחסנים בפורמט parquet יעיל ומחולקים לפי תצורות שפה. המבנה הפנימי פשוט ביותר ומבוסס על שדה יחיד בשם translation, שבתוכו מילון המכיל את שני קודי השפה שנבחרו. קובץ טיפוסי של צמד שפות יורד בגודל שנע בין עשרות למאות מגה בייטים בודדים, בהתאם להיקף הדוגמאות הקיים באותו צמד.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/europarl")

הרישיון

הרישיון המדווח בכרטיס הדאטהסט הוא unknown. המשמעות היא שאין הגדרה משפטית ברורה ומפורשת לגבי תנאי השימוש, ההפצה או ההטמעה של הנתונים. לשימוש מחקרי ובדיקות פנימיות זה בדרך כלל עובר, אבל אי אפשר לדעת אם מותר לאמן עליו מודלים מסחריים בלי להסתכן בהפרת זכויות יוצרים. מי שמתכנן להוציא מוצר לשוק חייב לבדוק את מקור הנתונים המקורי של פרויקט Europarl ו־OPUS לפני השימוש.

הרישיון המלא ב־Hugging Face ↗