GPT
P

ParallelFiction-Ja_En-100k

קוד פתוח

NilanEapache-2.02024-03-25

מאגר של פרקי רומנים יפניים מהרשת מול תרגומי מעריצים באנגלית, עם התאמה ברמת המשפט. הוא מיועד לתרגום מסמכים וטקסטים ספרותיים ארוכים, תחום שבו חסר דאטה מקביל איכותי.

  • 188הורדות בחודש
  • 82לייקים

מה זה

כל רשומה במאגר מחזיקה פרק שלם מרומן רשת יפני לצד התרגום המקביל שלו לאנגלית, כשהמשפטים מיושרים זה מול זה. המטרה המוצהרת היא תרגום ברמת מסמך שלם ולא רק משפטים בודדים ומנותקים מהקשר.

מדובר בגרסה שנייה שמכילה כעת 106 אלף פרקים, לעומת 103 אלף בגרסה הקודמת. המפתח שכתב את קוד יישור המשפטים כדי לפתור בעיות שעלו בדיונים, הוסיף מטא-דאטה של הסדרות ושמר על כותרות הפרקים. מבחינת סינון איכות התרגום, לא נעשה כאן שום סינון כזה לפי התיעוד, והיוצר ציין שהוא עדיין בודק שיטות לבצע את זה.

מתאים ל

  • אימון מודלי תרגום מסמכים

    לימוד מודלים לתרגם פסקאות ופרקים שלמים מיפנית לאנגלית תוך שמירה על הקשר רחב.

  • מחקר על יישור טקסט דו-לשוני

    בדיקת אלגוריתמים להתאמת משפטים בין שפות עם מבנה תחבירי שונה לחלוטין.

  • כוונון לתרגום ספרותי ודיאלוגים

    התאמת מודל שפה לסגנון הדיבור והכתיבה הייחודיים לרומנים יפניים ברשת.

איפה זה נופל

הבעיה המרכזית פה היא היעדר מוחלט של סינון איכות על התרגומים, מדובר בתרגומי מעריצים שיכולים להיות מדויקים מאוד או גרועים לחלוטין. בנוסף, הטקסט מוגבל ליפנית ולאנגלית בלבד, ומתמקד בסגנון כתיבה מאוד מסוים של רומני רשת, כך שהוא לא מתאים לאימון על טקסטים טכניים או יומיומיים. היישור ברמת המשפטים אמנם שוכתב, אבל עדיין עלול לכלול שגיאות יישור במעבר בין שפות שונות כל כך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

זה בעייתי מאוד מבחינה משפטית. הדף אמנם מסומן כ־Apache 2.0, אבל היוצר עצמו מבהיר שהטקסטים הם תרגומי מעריצים שנלקחו מאתרים ומופצים תחת שימוש הוגן בלבד. אם בעל זכויות ידרוש הסרה הטקסט יימחק, כך שלא כדאי לבנות עליו מוצר מסחרי.

האם יש במאגר טקסטים בעברית?

לא, המאגר כולל אך ורק יפנית ואנגלית. אין בו שום ייצוג לעברית או לשפות נוספות.

האם התרגומים עברו בקרת איכות כלשהי?

לא. הכרטיס מציין במפורש שלא הופעל שום סינון איכות על התרגומים, מכיוון שהמפתח עדיין מחפש דרכים לבצע זאת. חלק מהתרגומים עשויים להיות באיכות נמוכה או להכיל טעויות גסות.

איזה מידע נכלל בכל רשומה מעבר לטקסט עצמו?

בגרסה הזו נשמרו כותרות הפרקים המקוריות ונוסף מטא-דאטה ספציפי לגבי הסדרות שנאספו. הטקסטים עצמם מיושרים ברמת המשפט בתוך כל פרק.

איך טוענים

אתם מושכים את הקובץ ישירות מיוגינג פייס, כשהנתונים יושבים בקובץ JSONL בשם dataset-Ja_En-Massive-v2.jsonl. אין צורך לבקש אישור גישה והמאגר פתוח להורדה מיידית. שימו לב שהרשומות כוללות כעת כותרות פרקים ומטא-דאטה ייעודי לסדרות שנאספו, כך שכדאי לבדוק את המבנה של השורות לפני שדוחפים אותן לפייפליין האימון.

from datasets import load_dataset

ds = load_dataset("NilanE/ParallelFiction-Ja_En-100k")

הרישיון

המאגר מוגדר רשמית תחת apache-2.0, אבל יש פה כוכבית משפטית גדולה. היוצר מציין במפורש שהטקסטים עצמם מופצים תחת טענת שימוש הוגן, ושהוא לא עורך דין וממליץ לנהוג בזהירות. הוא מתחייב להסיר סדרות אם מחברים או מתרגמים ידרשו זאת. אם אתם מתכננים מוצר מסחרי, ההסתמכות על הטקסטים האלה מסוכנת מאוד מבחינת זכויות יוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗