GPT
O

opus-100

קוד פתוח

Helsinki-NLPunknown2022-03-02

מאגר נרחב של צמדי משפטים מקבילים לתרגום מכונה בין אנגלית לעשרות שפות, כולל עברית. הוא מתאים למי שרוצה לאמן או לבחון מודל תרגום בלי ללקט קורפוסים מפוזרים ברשת.

  • 19,989הורדות בחודש
  • 243לייקים

מה זה

המאגר מרכז קורפוסים מקבילים שנאספו מפרויקט OPUS עבור כמאה שפות שונות. כל רשומה כוללת שדה תרגום עם זוג משפטים מקבילים בין שפת מקור לשפת יעד, כאשר רוב הצמדים מקשרים בין אנגלית לשפה אחרת, לצד צמדים ספציפיים בין שפות מרכזיות כמו ערבית, גרמנית, צרפתית, רוסית וסינית.

מקור הנתונים מבוסס על טקסטים קיימים ברשת שנאספו ללא תיוג ידני חדש. עבור מרבית השפות הגדולות, כולל עברית, החלוקה הפנימית מציעה סט אימון של עד מיליון משפטים, וסטים של ולידציה ומבחן שמכילים בדיוק אלפיים משפטים כל אחד. בחלק מהשפות הדלות במשאבים יש רק כמה מאות או אלפי משפטים בודדים, ולעיתים אין בהן פיצול לולידציה או מבחן כלל.

מתאים ל

  • אימון מודלי תרגום

    בניית מודלים מבוססי טרנספורמר לתרגום בין אנגלית לשפות מגוונות.

  • בנצ׳מרק והערכת ביצועים

    שימוש בסט המבחן כדי למדוד ציוני BLEU של מודלי שפה.

  • מחקר על שפות מעוטות משאבים

    בדיקת יכולות העברה ולמידה עם מעט דוגמאות בשפות נדירות.

איפה זה נופל

הטקסטים נאספו ממקורות גולמיים ברשת ללא סינון ידני קפדני, מה שיוצר בעיות יישור ידועות, משפטים קטועים ותרגומים שגויים. שפות רבות סובלות ממחסור קיצוני בנתונים, לעיתים כמה מאות דוגמאות בלבד, מה שלא מאפשר אימון רציני. בנוסף, חלוקת הנתונים לא תמיד מבטיחה שאין זליגת מידע מאימון למבחן, והסגנון מוטה לתכנים ספציפיים שהיו זמינים ברשת, כמו כתוביות ותרגומים טכניים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לצרכים מסחריים?

הרישיון הרשמי מוגדר כלא ידוע, ולכן אין היתר שימוש מסחרי מפורש. מכיוון שהנתונים נאספו משלל מקורות חופשיים ומוגנים ברשת, שימוש מסחרי במודל שאומן עליהם דורש בירור מול המקורות הספציפיים של כל קורפוס.

האם יש תמיכה בעברית וכמה מידע קיים?

כן, קיים צמד של אנגלית ועברית תחת התצורה en-he. סט האימון מכיל מיליון צמדי משפטים, וסט המבחן והולידציה מכילים אלפיים משפטים כל אחד, בנפח הורדה של כשישים ואחד מגהבייט.

מה נפח האחסון שצריך להוריד?

הנפח תלוי לחלוטין בשפות שתבחרו להוריד. אם מורידים רק צמד אחד, לרוב מדובר בעשרות בודדות של מגהבייטים, אך הורדה מלאה של כל שלוש מאות וארבעת הקבצים מגיעה למספר גיגהבייטים של קבצי פרקט.

איך הנתונים נאספו והאם עברו בקרת איכות אנושית?

הנתונים נמשכו ישירות ממאגרי פרויקט OPUS, שמלקט טקסטים מקבילים מאתרים, כתוביות ומסמכים ציבוריים. אין תיוג אנושי ייעודי, ולכן קיימים משפטים באיכות משתנה, תרגומים עקיפים ושגיאות יישור בין שפת המקור ליעד.

איך טוענים

טוענים תצורה ספציפית לפי צמד השפות המבוקש, למשל en-he עבור אנגלית ועברית, ישירות דרך ספריית הדאטהסטים. הגישה פתוחה לגמרי ואין צורך באישור מיוחד. הנתונים שמורים כקבצי פרקט, והמבנה בכל רשומה כולל מילון תרגום פשוט עם שני קודי השפה. נפח ההורדה משתנה מאוד בין הצמדים, מעשרות קילובייטים בודדים לשפות נדירות ועד מעל מאה מגהבייט לקובץ דחוס בצמדים הגדולים.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/opus-100")

הרישיון

הרישיון המוגדר במאגר הוא לא ידוע. בפועל, הקורפוס הוא אוסף של מקורות שונים מתוך פרויקט OPUS, שלכל אחד מהם עשויים להיות תנאי שימוש נפרדים ומשתנים. אי אפשר להניח שמותר להשתמש בו למוצרים מסחריים בלי לבדוק את הרישיונות של תת המאגרים המקוריים, ואימון מודל מסחרי עליו חושף אתכם לסיכון משפטי של הפרת זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗