GPT
O

open_subtitles

קוד פתוח

Helsinki-NLPunknown2022-03-02

מאגר תרגום רב לשוני מבוסס כתוביות סרטים וסדרות מבית פרויקט OPUS. מיועד למי שמחפש טקסט דיאלוגי ודיבורי במגוון רחב של שפות, כולל עברית.

  • 757הורדות בחודש
  • 75לייקים

מה זה

המאגר מציע זוגות משפטים מתורגמים שנלקחו מכתוביות, במטרה לאמן מודלים של תרגום מכונה על שפה מדוברת ולא על טקסטים רשמיים או חדשותיים. הרשומות מבוססות על אתר OpenSubtitles ומקושרות למאגר של פרויקט OPUS. הכרטיס הנוכחי לא מפרט דוגמאות קונקרטיות למבנה הרשומה, אך הוא מפנה למאמר אקדמי מכנס LREC 2016 שמתאר את תהליך החילוץ והיישור של הכתוביות.

מבחינת חלוקה לחלקים, שדות מדויקים או אופן הסינון, הכרטיס ריק לחלוטין ומשאיר את רוב הפרטים תחת הערה שחסר מידע. היקף הרשומות המדווח בהאגינג פייס עומד בין עשרת אלפים למאה אלף, אך המאגר כולל עשרות שפות שונות, בהן אנגלית, ערבית, ספרדית, צרפתית וגם עברית, לצד ניבים ספציפיים כמו פורטוגזית ברזילאית או סינית מסורתית ומפושטת.

מתאים ל

  • אימון תרגום לשפה מדוברת

    לימוד מודלים לתרגם סלנג ודיאלוגים יומיומיים שלא קיימים בטקסטים רשמיים.

  • הערכת מודלי תרגום

    בדיקת ביצועי תרגום על טקסט שיחתי רב לשוני בין עשרות צמדי שפות.

  • מחקר בלשני חישובי

    ניתוח מקבילי של שפת דיבור ותחביר לא פורמלי על בסיס כתוביות.

איפה זה נופל

הכרטיס משאיר כמעט כל סעיף מהותי ריק. אין שום תיעוד של הטיות, סינון שפה פוגענית, הסרת פרטים אישיים או שיטת היישור בין שורות התרגום. בנוסף, כתוביות סרטים כוללות לעיתים קרובות תרגום חופשי, קיצורים כדי להתאים לקצב הדיבור על המסך, ותוכן ישן יחסית שהמאמר לגביו פורסם עוד ב־2016. בלי בדיקה ידנית מעמיקה של הפלט בצמד השפות שלכם, אתם מסתכנים בהכנסת שגיאות יישור ותרגומים לא מדויקים למודל.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון בכרטיס מסומן כלא ידוע ואין שום הצהרה על שימוש חופשי. לחברות שמפתחות מוצר אסור להניח שהשימוש מותר, וצריך לבדוק את תנאי הרישיון ישירות באתר של פרויקט OPUS לפני שנוגעים בו.

האם המאגר כולל עברית?

כן, קוד השפה he מופיע ברשימת השפות הנתמכות בכרטיס. אפשר לטעון צמד שמכיל עברית לצד שפה אחרת על ידי הגדרת הפרמטרים בסקריפט הטעינה.

איך נאסף המידע?

לפי הקישורים בכרטיס, הנתונים מקורם באתר OpenSubtitles ועובדו דרך פרויקט OPUS והמאמר שלהם מ־2016. הכרטיס עצמו לא מפרט את שלבי הניקוי, הסינון או היישור שנעשו בפועל.

כמה המאגר שוקל וכמה שורות יש בו?

נפח ההורדה המדויק לא מצוין בכרטיס, אך סדר הגודל המדווח עומד בין עשרת אלפים למאה אלף רשומות. הגודל הסופי תלוי גם בצמד השפות הספציפי שתבחרו למשוך.

איך טוענים

טוענים את הנתונים דרך load_dataset של ספריית datasets עם השם open_subtitles, ומגדירים את צמד השפות המבוקש בעזרת הפרמטרים lang1 ו־lang2, למשל עברית ואנגלית. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים, והסקריפט open_subtitles.py מנהל את המשיכה. גודל ההורדה המדויק ומבנה השדות הסופי אינם מתועדים בכרטיס, ולכן כדאי לבדוק מדגם קטן של השפות שבחרתם לפני שמתחילים ריצה כבדה.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/open_subtitles")

הרישיון

הרישיון הרשמי מוגדר כ־unknown ולא מופיע כל פירוט בכרטיס. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת אילו הגבלות חלות על מודל שאומן על הדאטה. עבור חברות או מוצרים מסחריים, שימוש במאגר בלי לברר את תנאי הרישיון המקוריים באתר OPUS הוא סיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗