GPT
O

opus-mt-en-de

קוד פתוח

Helsinki-NLPcc-by-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • rust

פתרון קומפקטי וממוקד לתרגום ישיר מאנגלית לגרמנית. הוא שוקל מעט, רץ מקומית בלי לגעת בענן ואינו דורש שרתים כבדים כדי לעבוד מהר.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 413,726הורדות בחודש
  • 47לייקים

מה זה

מדובר במודל תרגום ייעודי המבוסס על ארכיטקטורת MarianMT, שפותח באוניברסיטת הלסינקי כדי לבצע משימה אחת: לקחת טקסט באנגלית ולהוציא אותו בגרמנית. בניגוד למודלי שפה ענקיים שמנסים לעשות הכול, כאן מקבלים כלי קטן שעושה פעולה מוגדרת בלי שכבת ניהול מיותרת.

התוצאות שלו מציגות פערים משמעותיים בין מבחנים שונים. במבחני חדשות ישנים יותר מ־2009 ציוני ה־BLEU נעים סביב 22 עד 24, שזה תרגום בסיסי שמפספס דיוקים, אבל במבחנים עדכניים יותר כמו newstest2018 ו־Tatoeba הוא מטפס ל־45.2 ו־47.3 עם מדדי chr-F של קרוב ל־0.7. המספרים האלה מראים שבטקסטים סטנדרטיים ומשפטים מוגדרים הוא מספק גרמנית שוטפת, אבל במבנים מורכבים יותר האיכות יורדת.

מתאים ל

  • תרגום ממשקי משתמש

    הוא קל משקל ומתאים לתרגום מחרוזות קצרות באנגלית לגרמנית בתוך תהליך בילד מקומי.

  • עיבוד מקומי ומאובטח

    תרגום מסמכים פנימיים בארגון שלא מאפשר שליחת מידע החוצה לספקי ענן צד שלישי.

  • קדם־תרגום לנפחים גדולים

    מעבר ראשוני ומהיר על כמויות טקסט גדולות לפני עריכה אנושית, בעלות חומרה נמוכה.

איפה זה נופל

הכרטיס מזהיר במפורש מפני הטיות היסטוריות, סטראוטיפים ותכנים פוגעניים שעלולים לצוף בתרגום בגלל דאטה האימון. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שאי אפשר לזרוק עליו מסמכים שלמים בלי לחתוך אותם קודם. מי שבונה עליו לטקסטים ארוכים יגלה שהוא מאבד הקשר בין פסקאות, ופער הציונים במבחנים מראה שהוא עלול לייצר תרגום עצי ולא אחיד.

שאלות
נפוצות

האם המודל הזה תומך בתרגום לעברית?

לא. המודל אומן ספציפית לצמד השפות אנגלית למקור וגרמנית ליעד. הוא לא מזהה עברית ולא יודע לייצר שום שפה אחרת חוץ מגרמנית.

האם צריך מחשב חזק עם GPU כדי לעבוד איתו?

ממש לא. בגלל שמדובר ב־6 שכבות בלבד ובמשקל של 1.3 גיגהבייט, אפשר להריץ אותו על מעבד רגיל בשרת פשוט או על מחשב נייד, והוא יחזיר תשובות בזמן סביר.

האם אפשר לשלוח אליו מאמרים שלמים בבת אחת?

לא מומלץ. חלון ההקשר שלו נעצר ב־512 טוקנים, ולכן טקסטים ארוכים יש להפריד למשפטים או פסקאות קצרות לפני השליחה כדי למנוע חיתוך ואיבוד מידע.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers באמצעות AutoTokenizer ו־AutoModelForSeq2SeqLM. עם משקל כולל של 1.3 גיגהבייט ו־6 שכבות, כל מעבד סביר יכול להריץ אותו בלי לחנוק את המערכת, ואין חובה להחזיק כרטיס מסך ייעודי כדי לקבל תגובה מהירה.

אם אתם צריכים תרגום של משפטים בודדים פה ושם, קריאה לשירות חיצוני כנראה פשוטה יותר מניהול תהליך עצמאי. לעומת זאת, כשיש לכם נפח קבוע של טקסטים, חשש מפרטיות או צורך לעבוד ללא חיבור רשת, הרצה מקומית של הקבצים האלה סוגרת את הפינה בעלות אפסית כמעט.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-en-de")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-4.0, מה שמאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי והטמעה במוצרים סגורים. התנאי היחיד שאתם חייבים לעמוד בו הוא מתן קרדיט ברור לחוקרים מאוניברסיטת הלסינקי שפיתחו את המודל ולציין אם בוצעו בו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗