GPT
O

opus-mt-mul-en

קוד פתוח

Helsinki-NLPapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • marian
  • text2text-generation

פתרון קל משקל לתרגום ישיר ממאות שפות לאנגלית בלבד. הוא מתאים למי שחייב ריצה מקומית בלי תלויות חיצוניות ועל חומרה בסיסית.

  • 512טוקנים בהקשר
  • 595 MBמשקל הקבצים
  • 76,413הורדות בחודש
  • 89לייקים

מה זה

מדובר במודל תרגום מבוסס MarianMT עם שש שכבות בלבד, שתוכנן לקלוט טקסט במגוון עצום של שפות מקור ולפלוט אנגלית. המשקל הכולל שלו עומד על 595 מגה בייט, כך שהוא נכנס בקלות לזיכרון של כל שרת סטנדרטי בלי לדרוש משאבי מחשוב כבדים.

במבחני Tatoeba הרב לשוניים הוא מציג ציון BLEU ממוצע של 34.7 ומדד chr-F של 0.518, אבל המספרים האלה מטעים אם מסתכלים עליהם כמקשה אחת. בשפות אירופיות נפוצות כמו ספרדית או איטלקית התוצאות מגיעות לטווח של 47 עד 55 נקודות, בעוד שפות כמו עברית מקבלות 33, ובשפות נדירות הציון צונח קרוב לאפס.

ההבדל העיקרי בינו לבין מודלים מודרניים הוא המיקוד החד כיווני שלו. הוא לא מנסה להבין שיחה ולא מייצר טקסט חופשי, אלא רק מעביר משפטים קצרים לאנגלית בעזרת טוקנייזר SentencePiece של 32 אלף מונחים.

מתאים ל

  • נרמול טקסט רב לשוני לאנגלית

    הוא ממיר הודעות קצרות מעשרות שפות לשפה אחידה כדי להזין אותן למנוע חיפוש פנימי.

  • תרגום מקומי על מכשירי קצה

    משקלו נמוך מ־600 מגה בייט, ולכן אפשר להריץ אותו ישירות על מחשבים פשוטים בלי חיבור לרשת.

  • קריאת כותרות ופידים זרים

    הוא מפיק תרגום אנגלי גולמי ומהיר לצורך סריקה של עדכוני חדשות קצרים ממקורות בינלאומיים.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, מה שמונע ממנו לטפל בפסקאות ארוכות או לשמור על עקביות לאורך טקסט מתמשך. מעבר לכך, פערי האיכות בין השפות קיצוניים. בעוד שגרמנית וצרפתית מקבלות תרגום סביר בהחלט, עברית מגיעה לציון BLEU של 33 בלבד במבחן Tatoeba, ושפות כמו גוג'ראטית קיבלו 9 בלבד במבחני חדשות. הוא מתקשה בסלנג, במונחים טכניים ובמבנים תחביריים מפותלים, וחובה לדגום את התוצאות שלו בשפת היעד לפני שמשלבים אותו בזרימת עבודה.

שאלות
נפוצות

האם אפשר לתרגם בעזרתו טקסט מאנגלית לשפות אחרות?

לא. המודל בנוי ומאומן לכיוון אחד בלבד, שבו עשרות שפות שונות נכנסות כמקור והפלט המתקבל הוא תמיד באנגלית.

איך הוא מתמודד עם תרגום טקסטים בעברית?

הוא מתמודד בצורה בינונית בלבד עם ציון של 33 במבחני Tatoeba. לא הייתי משתמש בו לטקסט ספרותי או שיווקי, אלא למשפטים פשוטים וברורים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון עם ארכיטקטורת MarianMTModel. בגלל הגודל המזערי שלו, 595 מגה בייט בסך הכול, אין צורך במאיץ גרפי ייעודי והוא רץ מהר מאוד על גבי מעבד רגיל בכל מכונה וירטואלית זולה.

אם אתם צריכים לתרגם טקסטים ארוכים, מסמכים מורכבים או שפות שאינן אירופיות קלאסיות, עדיף לקרוא ל־API חיצוני של מודל ענן גדול. הרצה עצמית של המודל הזה משתלמת כשרוצים אפס עלויות שוטפות, פרטיות מלאה של המידע או עיבוד מהיר במנות גדולות של משפטים קצרים.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-mul-en")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, והוא מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית כחלק ממוצר. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים המקורית וציון הרישיון בכל הפצה של הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗