GPT
I

iitb-english-hindi

קוד פתוח

cfiltרישיון לא דווח2022-03-02

קורפוס מקבילי לתרגום בין אנגלית להינדי שנאסף לאורך שנים במוסד הודי מוביל. החומר משמש כמדד ייחוס מרכזי בסדנאות תרגום אסיאתיות וכולל פיצול מובנה לאימון, אימות ובדיקה.

  • 1,605הורדות בחודש
  • 70לייקים

מה זה

המאגר כולל זוגות משפטים מקבילים באנגלית ובהינדי, שנאספו ממגוון מקורות קיימים ופרויקטים שפותחו במרכז לטכנולוגיית שפות הודיות ב־IIT Bombay לאורך השנים. מטרת האיסוף הייתה להעמיד משאב סטנדרטי למשימות תרגום מכונה, והוא שימש במשימות משותפות של סדנת תרגום השפות האסיאתיות עוד משנת 2016 עבור תרגום ישיר וגם כשפת ציר מול יפנית.

הנתונים במאגר מחולקים לקובצי אימון, בדיקה ואימות בפורמט Parquet, שנוצרו במקור כדי לאפשר עבודה ישירה מול ספריות עיבוד נתונים מודרניות. בהיסטוריית העדכונים של הפרויקט התווספו עשרות אלפי זוגות משפטים, כולל כ־47,000 זוגות בגרסה שלוש באוגוסט 2020 ועוד 49,400 זוגות בדצמבר 2021 בגרסה שלוש נקודה אחת. מעבר לחלק המקבילי, היוצרים מציינים באתר הפרויקט קיומו של קורפוס הינדי חד-לשוני נפרד שזמין להורדה ישירה דרך האתר שלהם ולא מגיע כחלק ישיר מקובצי התרגום שכאן.

מתאים ל

  • אימון מודלי תרגום

    בנייה וכוונון של מערכות תרגום ישיר בין אנגלית להינדי על בסיס קורפוס מקבילי מוכר.

  • הערכת ביצועי מודלים

    שימוש בחלקי הוולידציה והבדיקה כמבחן ייחוס תקני להשוואת איכות תרגום במחקרים.

  • אימון שפות ציר

    שימוש בזוג השפות כבסיס גישור לתרגום עקיף מול שפות אסיאתיות נוספות כמו יפנית.

איפה זה נופל

הנתונים מתמקדים אך ורק בצמד השפות אנגלית והינדי, כך שאין כאן שום מגע עם עברית או שפות שמיות אחרות. הכרטיס לא מפרט את הליכי הסינון, בקרת האיכות או מקורות הטקסט המדויקים, ולכן לא ברור אילו הטיות תרבותיות, סגנוניות או נושאיות קיימות בפנים. בנוסף, מדובר באיסוף שהחל לפני שנים רבות ועבר הרחבות עד סוף 2021, כך שהטקסטים לא משקפים שינויי שפה מהשנים האחרונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, השימוש המסחרי חסום על פי תגית הרישיון שמופיעה בתיאור המאגר. אף על פי שבמערכת הראשית הרישיון מסומן כחסר, הכרטיס מפנה לרישיון CC BY-NC 4.0 שמתיר שימוש לא מסחרי בלבד. אם אתם בונים כלי למכירה או לשימוש ארגוני פנימי, תצטרכו לחפש מקור חלופי.

האם יש במאגר טקסטים בעברית?

המאגר אינו מכיל עברית כלל, אלא מוגבל כולו לאנגלית ולהינדי. הוא מתאים אך ורק לחוקרים שמפתחים מודלים עבור השפות הללו או זקוקים לשפת ציר הודית. למפתחים מקומיים שמחפשים דאטה בעברית אין מה לחפש כאן.

מאיפה הגיעו הטקסטים שנמצאים בקורפוס?

החומרים נאספו ממגוון מקורות קיימים ופרויקטים שפותחו במרכז לטכנולוגיית שפות הודיות של IIT Bombay. הקורפוס עבר הרחבות ועדכונים לאורך הזמן, כולל תוספות משמעותיות בשנים 2020 ו־2021. פירוט מעמיק על המקורות המדויקים מופיע במאמר האקדמי שפורסם בכנס LREC 2018.

מה נדרש כדי להתחיל לעבוד איתו בקוד?

אין צורך בטפסים, מפתחות מיוחדים או אישורי גישה, והמאגר זמין לטעינה חופשית ברשת. הקבצים שמורים בפורמט Parquet בחלוקה מוכנה לאימון, ולידציה ובדיקה שנטענת מיד לפייתון. היוצרים מספקים גם מחברת לדוגמה שמדגימה שלבי עיבוד מקדים והכנה לתרגום מכונה.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה באמצעות המזהה cfilt/iitb-english-hindi בלי צורך בבקשת גישה מיוחדת או אישור מוקדם. המאגר מגיע כבר מחולק לחלקי אימון, ולידציה ובדיקה בקובצי Parquet מוכנים, כך שאין צורך לחלק לבד. היוצרים מפנים למחברת פייתון בגיטהאב שמציגה תהליך מלא של ייבוא, טוקניזציה בשיטת BPE והכנת הטקסט למודל תרגום.

from datasets import load_dataset

ds = load_dataset("cfilt/iitb-english-hindi")

הרישיון

המטא-דאטה מציג מצב שבו לא דווח רישיון רשמי במערכת, אבל הכרטיס עצמו כולל תג של רישיון CC BY-NC 4.0 לצד קובץ רישיון ייעודי במאגר. המשמעות ברורה וחד משמעית, השימוש מוגבל למחקר ולמטרות לא מסחריות בלבד, עם חובת מתן קרדיט לחוקרים. מודל שתאמנו על הבסיס הזה לא יוכל להיכנס למוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗