GPT
U

un_pc

קוד פתוח

Helsinki-NLPother2022-03-02

מאגר ענק של מסמכי או"ם רשמיים שתורגמו ידנית בין שש שפות. הוא מיועד למי שמאמן מודלי תרגום מכונה וצריך טקסט מוסדי באיכות גבוהה.

  • 3,276הורדות בחודש
  • 28לייקים

מה זה

המאגר כולל עשרות מיליוני זוגות משפטים מקבילים שנלקחו מתוך מסמכים רשמיים של האומות המאוחדות לאורך 25 שנה, בין 1990 ל־2014. כל הטקסטים תורגמו בידי מתרגמים אנושיים של האו"ם ולא נוצרו במכונה, מה שמבטיח איכות תרגום עקבית ומדויקת.

התוכן מכסה את שש השפות הרשמיות של הארגון בלבד: ערבית, אנגלית, ספרדית, צרפתית, רוסית וסינית. הקבצים במאגר מחולקים לפי צמדי שפות, כמו למשל ערבית מול אנגלית, ומאוחסנים במאות קובצי פרקט שמכילים את מקטעי הטקסט המקבילים לצורכי אימון.

הכרטיס הנוכחי לא מפרט את אופן הסינון והיישור שבוצעו בין המשפטים ברמת ההנדסה. אין כאן תיעוד של חלוקה מוגדרת למבחן או אימות, כך שאתם מקבלים ישירות את חלקי האימון הגולמיים ונדרשים לפצל אותם בעצמכם.

מתאים ל

  • אימון מודלי תרגום

    אימון רשתות נוירונים לתרגום מדויק בין שש השפות הרשמיות של האו"ם.

  • בניית מילונים מקבילים

    חילוץ מונחים מקבילים והקשרים לשוניים בטקסטים דיפלומטיים ומשפטיים.

  • הערכת ביצועי מודלים

    בדיקת איכות של מנועי תרגום קיימים מול תרגום אנושי מקצועי.

איפה זה נופל

הטקסט כולו לקוח מנאומים, החלטות ופרוטוקולים של האו"ם, מה שמייצר שפה דיפלומטית כבדה ורשמית מאוד. המאגר נסגר בשנת 2014, כך שאין בו מונחים מודרניים או שפה עדכנית מהעשור האחרון. עברית לא קיימת כאן בכלל, והכרטיס אינו מפרט הטיות מובנות או מידע רגיש, ולכן תצטרכו לנקות את הנתונים בעצמכם.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא, המאגר לא כולל עברית כלל. הוא מכיל אך ורק את שש השפות הרשמיות של האו"ם: ערבית, סינית, אנגלית, צרפתית, רוסית וספרדית. למפתחים ישראלים הוא יכול להתאים בעיקר לעבודה מול ערבית או אנגלית.

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המוגדר הוא רישיון ייעודי של האו"ם שמציין תנאים ליברליים, אך אינו מציין במפורש תנאים מסחריים מודרניים. התנאי המרכזי שמופיע בהסכם הוא מתן ייחוס וציטוט של המאמר המדעי המקורי מ־2016. מומלץ לבדוק את נוסח הוויתור המלא באתר האו"ם לפני שמשלבים אותו במוצר מסחרי סגור.

איך נוצרו התרגומים בדאטהסט?

הנתונים נאספו מתוך עבודת התרגום הרשמית של מתרגמי האו"ם בין השנים 1990 ל־2014. מדובר בתרגום אנושי מלא של מסמכים מוסדיים ולא בפלט של מנועי תרגום מכונה. התוכן מייצג ניסוח מקצועי ברמה גבוהה מאוד של פרוטוקולים והחלטות.

איך טוענים

הנתונים מחולקים ל־266 קובצי פרקט לפי צמדי שפות, כמו תיקיית ar-en שכוללת לבדה 17 חלקים. המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מראש. בגלל שמדובר בעשרות מיליוני רשומות, מומלץ לעבוד עם טעינה מוזרמת כדי לא לחנוק את זיכרון העבודה של השרת.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/un_pc")

הרישיון

הרישיון מוגדר בתור רישיון ייעודי של האו"ם ומוגדר כליברלי. הוא מחייב לתת קרדיט מלא למאגר ולצטט את המאמר של החוקרים מ־2016. אין פירוט חד משמעי לגבי שימוש מסחרי ישיר במודלים מאומנים, אך הארגון מסיר כל אחריות לתוצאות השימוש בנתונים.

הרישיון המלא ב־Hugging Face ↗