GPT
O

opus_books

קוד פתוח

Helsinki-NLPother2022-03-02

מאגר קטן של ספרי קריאה מתורגמים בין שפות אירופיות. הוא מתאים למי שרוצה לבדוק תרגום מכונה על טקסט ספרותי עשיר ולא על חדשות.

  • 8,080הורדות בחודש
  • 96לייקים

מה זה

המאגר מיועד למשימות תרגום מכונה ומכיל משפטים מקבילים שנלקחו מתוך ספרים קלאסיים וספרות חופשית. בניגוד לרוב הקורפוסים ברשת שנשענים על פרוטוקולים של פרלמנטים או כתוביות, הטקסט פה מציג מבנים תחביריים מורכבים, אוצר מילים תיאורי ומשלבי שפה ספרותיים.

המבנה מאורגן לפי צמדי שפות ספציפיים, כאשר כל קובץ כולל טקסט מקור ותרגום מקביל. רשימת השפות כוללת אנגלית, גרמנית, צרפתית, ספרדית, איטלקית, הולנדית, פינית, יוונית, הונגרית, קטלאנית, אספרנטו ונורווגית. הנתונים מחולקים למקטעים, אך הדף המקורי לא מפרט תהליכי סינון מורכבים מעבר לחלוקה הבסיסית של צמדי השפות.

ההיקף הכולל עומד על כמה אלפי רשומות בודדות בכל צמד, כך שלא מדובר במאגר ענק. המטרה העיקרית שלו היא לספק קרקע ממוקדת לטקסט ספרותי עבור שפות אירופיות מרכזיות, לצד מספר שפות פחות שכיחות כמו אספרנטו.

מתאים ל

  • בדיקת איכות תרגום לספרות

    הרצת מבחני הערכה למודלי תרגום כדי לראות איך הם מתמודדים עם משפטים מורכבים.

  • התאמת סגנון למודל קיים

    כוונון עדין של מודל כללי כדי להקנות לו משלב ספרותי בשפות אירופיות.

  • מחקר בלשני חישובי

    ניתוח השוואתי של תרגומי ספרים קלאסיים בין משפחות שפות שונות ביבשת.

איפה זה נופל

הבעיה המרכזית היא חוסר בעברית, המאגר מתרכז באירופה בלבד. בנוסף, הנפח הכולל קטן מאוד ועומד על בין אלף לעשרת אלפים רשומות, מה שלא יספיק לבדו לאימון מודל תרגום מאפס. שפה ספרותית נוטה להיות ארכאית ומלאה במטפורות, ולכן מודל שיתבסס עליה יתקשה לתרגם שיחות יומיומיות, ממשקים או מסמכים טכניים בלי להתבלבל בנימה ובסגנון.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא, אין בו עברית בכלל. המאגר מוגבל לשפות אירופיות כמו אנגלית, גרמנית, צרפתית ואחרות, לצד אספרנטו. אם אתם מחפשים דאטה בעברית תצטרכו לפנות לקורפוסים מקבילים אחרים.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון מוגדר רק בתור רישיון מותאם אחר, ולא כרישיון קוד פתוח סטנדרטי. בגלל שהטקסטים מגיעים מספרים, יש סיכון סביב זכויות יוצרים של תרגומים. מומלץ לא להשתמש בזה למוצר מסחרי בלי בדיקה מעמיקה של מקורות הספרים.

כמה מקום המאגר תופס במחשב?

ההורדה מהירה מאוד ושוקלת מעט. מדובר בשישים ושישה קבצי פרקט קטנים שמכילים בין אלף לעשרת אלפים רשומות בסך הכל. אפשר לטעון ולעבד את הכל על מחשב נייד רגיל בלי לחשוב פעמיים.

מה ההבדל בינו לבין קורפוסים אחרים של תרגום?

רוב מאגרי התרגום מבוססים על פרוטוקולים של האיחוד האירופי או כתוביות של סרטים, שפה פשוטה ויבשה יחסית. כאן מדובר בספרים, מה שמספק אוצר מילים רחב בהרבה ומבנה משפטים עמוס יותר. החיסרון הוא שהכמות כאן זעירה בהשוואה למאגרי ענק אלה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות המזהה, ללא צורך בהרשמה או בבקשת אישור גישה מיוחדת. המאגר פתוח לחלוטין ומאוחסן בפורמט פרקט, מה שהופך את השליפה למהירה וחסכונית במשאבים.

בתוך המאגר יש 66 קבצים שמחולקים לפי צמדי שפות, כמו קטלאנית גרמנית או גרמנית אנגלית. כל קובץ כולל שדות של טקסט המקור וטקסט היעד ברמת המשפט. הגודל הכולל זעיר ביחס למאגרי תרגום אחרים, ולכן תהליך ההורדה והטעינה לזיכרון אורך שניות ספורות גם על מחשב אישי בסיסי.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/opus_books")

הרישיון

הרישיון מוגדר כסוג אחר, ללא פירוט מפורש בכרטיס. במצב כזה אסור להניח שהשימוש המסחרי מותר. אם אתם מתכננים להשתמש בזה למוצר, חובה לפנות לפרויקט המקור או לבדוק את זכויות היוצרים של הספרים עצמם כדי לא להסתכן בהפרת קניין רוחני.

הרישיון המלא ב־Hugging Face ↗