GPT
T

tatoeba

קוד פתוח

Helsinki-NLPcc-by-2.02022-03-02

מאגר משפטים מתורגמים במגוון עצום של שפות שנלקח ממיזם טטואבה. הוא מתאים למי שבונה או בודק מנועי תרגום וזקוק למשפטים יומיומיים קצרים.

  • 955הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל זוגות של משפטים ותרגומים שנאספו מתוך פרויקט Tatoeba דרך ארכיון OPUS. הרשומות מבוססות על תרומות של קהילת המשתמשים באתר המקורי, שמזינה משפטים ותרגומים במגוון רחב של שפות, כולל שפות נדירות, ניבים אזוריים ושפות היסטוריות.

כרטיס הדאטהסט לא מפרט תהליכי סינון, ניקוי או נרמול שבוצעו על הטקסטים לפני העלאתם. אין פירוט לגבי חלוקה מובנית לקבוצות אימון, בדיקה או תיקוף, ולמעשה רוב השדות התיעודיים בכרטיס הושארו ריקים על ידי המפרסם מלבד רשימת קודי השפות והפניות למאמר המקורי.

המבנה מאפשר גישה לגרסאות תאריך שונות של הדאטהסט, כאשר ברירת המחדל מבוססת על יולי 2021, לצד אפשרות למשוך גרסאות קודמות יותר ישירות דרך הגדרות הטעינה בקוד.

מתאים ל

  • אימון מודל תרגום

    משמש כחומר גלם מקביל לאימון או fine-tuning של מנועי תרגום מכונה בצמדי שפות ספציפיים.

  • בדיקת איכות והערכה

    משמש לבחינת דיוק התרגום של מודלים קיימים על משפטים קצרים מהחיים האמיתיים.

  • מחקר בלשני חישובי

    ניתוח השוואתי של מבנים תחביריים ותרגום בין עשרות שפות שונות הקיימות במאגר.

איפה זה נופל

הכרטיס ריק כמעט לחלוטין ממידע ביקורתי. אין בו שום תיעוד על הטיות אפשריות, בדיקות איכות או טיפול במידע אישי ורגיש. מאחר שהמקור הוא מיזם פתוח מבוסס המונים, איכות התרגום אינה אחידה ומשתנה מאוד בין שפות פופולריות לשפות נידחות. כמו כן, הנתונים הוקפאו בסביבות 2021 ואינם מתעדכנים אוטומטית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים מסחריים. התנאי המרכזי הוא מתן קרדיט ברור למקור בהתאם להנחיות הרישיון.

האם הדאטהסט כולל תרגומים לעברית?

כן, הקוד he מופיע ברשימת השפות הנתמכות בכרטיס. אפשר לטעון זוגות שמכילים עברית, כמו אנגלית ועברית, על ידי ציון הקודים בקריאת הטעינה.

מאיפה הגיעו המשפטים ואיך הם נאספו?

המשפטים מגיעים מפרויקט Tatoeba, אתר שיתופי שבו מתנדבים כותבים ומתרגמים משפטים לצורכי לימוד שפות. Helsinki-NLP ארזו את הנתונים כחלק ממיזם OPUS.

איך טוענים

טוענים את הנתונים ישירות מספריית datasets באמצעות קריאה לפונקציה load_dataset עם המזהה tatoeba. חובה להגדיר את שני קודי השפה הרצויים בפרמטרים lang1 ו־lang2, למשל en ו־he. הגישה פתוחה ואין צורך באישורי גישה מיוחדים. המאגר כולל סקריפט טעינה בשם tatoeba.py שמושך את זוגות השפות הנבחרים ממאגר OPUS, וניתן להגדיר בו גם פרמטר תאריך לגרסה ספציפית.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/tatoeba")

הרישיון

המאגר מופץ תחת רישיון cc-by-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, אך מחייב מתן קרדיט מתאים ליוצרים המקוריים וציון השינויים שנעשו. הוא אינו כולל דרישה לשיתוף באותו רישיון עבור המודל שתאמנו עליו.

הרישיון המלא ב־Hugging Face ↗