GPT
T

tatoeba_mt

קוד פתוח

Helsinki-NLPcc-by-2.02022-03-02

מאגר משפטים מקבילים לבדיקה והערכה של מודלי תרגום במאות שפות. פתרון נוח כשצריך בנצ׳מרק מוכן לצמדי שפות נדירים, בלי להרכיב טסט סט מאפס.

  • 5,747הורדות בחודש
  • 63לייקים

מה זה

המאגר מציע מערכי בדיקה ופיתוח שנבזרו מתוך Tatoeba.org דרך פרויקט OPUS. כל רשומה מורכבת מארבע עמודות בקובץ מופרד טאבים: קוד שפת מקור, קוד שפת יעד, טקסט המקור וטקסט היעד. הנתונים סימטריים לחלוטין ומתאימים להרצה בשני כיווני התרגום, כאשר צמדי השפות מסודרים לפי קודי ISO-639-3.

החלוקה הפנימית מפרידה בין סטים של בדיקה וסטים של פיתוח, ללא חפיפה של זוגות משפטים מלאים ביניהם, אם כי משפט בודד יכול להופיע ביותר מהקשר אחד. סטי הבדיקה מוגבלים לגודל של עד 10,000 רשומות לכל צמד שפות, וערכות פיתוח לא קיימות עבור כל השפות. חלק מהקבצים מכילים גם ניסוחים שונים באותה שפה או וריאציות כתיב עם סימון מערכת הכתב המתאימה.

מתאים ל

  • הערכת מודלי תרגום

    בדיקת ביצועים מהירה על צמדי שפות מגוונים בעזרת סטים נקיים מחלוקות האימון המקוריות.

  • תרגום לשפות מעוטרות משאבים

    מדידת יכולות תרגום בשפות עם מעט דאטה פומבי, איפה שמשפטים קצרים מספיקים לבחינה ראשונית.

  • בדיקת ניסוחים חלופיים

    שימוש בזוגות משפטים מאותה שפה לבדיקת זיהוי פראפרזות או שגיאות כתיב קלות.

איפה זה נופל

המשפטים במאגר קצרים ופשוטים מאוד במבנה שלהם. מודל שמקבל ציון מעולה כאן עדיין יכול לקרוס על פסקאות מורכבות, מסמכים טכניים או סלנג עכשווי. בנוסף, התרגומים נתרמו על ידי משתמשי אינטרנט מתנדבים, חלקם אינם דוברי השפה ברמת שפת אם, והפרויקט לא עשה שימוש בדירוגי האיכות של האתר כדי לסנן רעש. אין כאן שום סינון של פרטים אישיים או מידע רגיש, כך שחובה לסנן את החומר לפני שחושפים אותו למשתמשי קצה.

שאלות
נפוצות

האם יש במאגר עברית?

כן, עברית מופיעה ברשימת השפות הנתמכות לפי כרטיס הדאטהסט. עם זאת, רשימת הקודים הראשית בעמוד כוללת עשרות שפות בלבד, ולכן יש לבדוק את קובצי ה־TSV כדי לראות אילו צמדים ספציפיים כוללים עברית.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, רישיון CC-BY 2.0 מאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן ייחוס מתאים לפרויקט Tatoeba ולחוקרים מאוניברסיטת הלסינקי שריכזו את הדאטהסט.

האם הדאטהסט מיועד לאימון מודלים?

הקבצים במאגר הזה נועדו להערכה ופיתוח בלבד, וערכות המבחן מוגבלות לעד 10,000 משפטים לצמד. החוקרים מפנים למאגר הגיטהאב של Tatoeba Challenge כדי להוריד את קובצי האימון המלאים.

האם הטקסטים עברו סינון של שפה בוטה או מידע אישי?

לא. החוקרים מציינים מפורשות שהנתונים לא עברו שום עיבוד לזיהוי או הסרה של מידע רגיש ואישי, ואין להסתמך עליהם כנקיים בלי בדיקה עצמאית.

איך טוענים

אין צורך באישור גישה כדי להוריד את הקבצים. המאגר מכיל 1,347 קבצים ומאורגן בקובצי TSV ישירים לפי צמדי שפות, כמו תיקיית dev עם קבצים ייעודיים לכל שילוב. בטעינה דרך הספרייה או ישירות מהדיסק, חשוב לעבוד עם ארבע עמודות הטקסט והשפות, ולשים לב שמשקל הנתונים המלא ומספר הרשומות הכולל אינם מוגדרים מראש בעמוד.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/tatoeba_mt")

הרישיון

הנתונים מופצים ברישיון CC-BY 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו דורש שיתוף באותו רישיון. החובה העיקרית היא מתן קרדיט מתאים למקור. אפשר לאמן ולהעריך מודלים מסחריים על הבסיס הזה, כל עוד מקפידים על תנאי הייחוס של Tatoeba והחוקרים.

הרישיון המלא ב־Hugging Face ↗