GPT
O

opus-mt-ru-en

קוד פתוח

Helsinki-NLPcc-by-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • marian

תרגום מרוסית לאנגלית בלי תלות בענן ובלי לשלם על כל מילה. הוא קל משקל, רץ מקומית בכל מקום ומתאים למי שחייב לעבד כמויות בלי לשלוח מידע החוצה.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 300,346הורדות בחודש
  • 102לייקים

מה זה

מדובר במודל ייעודי לתרגום מרוסית לאנגלית בלבד, שמבוסס על ארכיטקטורת MarianMT עם שש שכבות. הוא לא מודל שפה כללי שמנסה להבין עולם, אלא רכיב שעושה פעולה אחת פשוטה וישירה מקצה לקצה דרך ספריית transformers.

במבחני BLEU על מערכי חדשות הוא מגרד ציונים סביב 30 עד 34, שזה מספיק כדי להבין את המשמעות של טקסט חדשותי אבל רחוק מתרגום ספרותי מושלם. במאגר Tatoeba, שמכיל משפטים קצרים ויומיומיים יותר, הוא קופץ לציון 61.1, מה שמראה שמשפטים פשוטים עובדים אצלו מצוין בעוד שטקסט מורכב ומפותל מאתגר אותו בהרבה.

מתאים ל

  • תרגום הודעות וטלגרם

    מעבד טקסטים קצרים מרוסית בזמן אמת, מקומית וביעילות בלי לשלוח מידע לרשת.

  • פייפליין מקומי למסמכים

    תרגום מהיר של קטעי חדשות ומידע גולמי באנגלית, לפני הזנה למודלים אחרים.

  • עיבוד מידע רגיש אופליין

    שמירה מלאה על פרטיות הנתונים, בגלל שכל העיבוד נעשה על הברזלים שלכם.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר לזרוק אליו מסמכים ארוכים בבת אחת בלי לחתוך אותם לפסקאות קודם. הוא גם מתרגם בכיוון אחד בלבד, מרוסית לאנגלית, בלי יכולת להחזיר תרגום הפוך. מעבר לזה, הכרטיס מדגיש שהתוכן עלול לשקף הטיות, סטריאוטיפים היסטוריים וביטויים פוגעניים שהיו קיימים במידע המקורי של OPUS, ולכן חובה לבדוק ולסנן את הפלט אם מציגים אותו למשתמשי קצה.

שאלות
נפוצות

האם המודל יכול לתרגם גם מאנגלית לרוסית?

לא. הוא אומן אך ורק בכיוון של רוסית למקור ואנגלית ליעד. אם תזינו לו אנגלית, תקבלו פלט שבור לחלוטין, ותרגום הפוך דורש מודל נפרד.

האם חייבים GPU בשביל להריץ אותו במוצר?

ממש לא. בגלל הגודל הקומפקטי שלו, הוא רץ מעולה על מעבד סטנדרטי בלי צווארי בקבוק מורגשים, כל עוד לא מדובר באלפי בקשות בשנייה.

איך מריצים

טוענים אותו ישירות דרך AutoModelForSeq2SeqLM ו־AutoTokenizer של transformers. הקבצים שוקלים 1.1 גיגה בייט בלבד, כך שלא צריך כרטיס מסך מפלצתי או שרת יקר, והוא יכול לרוץ בקלות על מעבד רגיל בכל לפטופ או שרת בסיסי.

הוא שווה את זה רק אם יש לכם נפח עבודה רציף, חשש מפרטיות או צורך בהרצה מקומית מנותקת. אם אתם צריכים לתרגם רק כמה משפטים פעם ביום, הקמה ותחזוקה של סביבת פייתון בשבילו פשוט מיותרות ועדיף להשתמש בפתרון מוכן.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-ru-en")
print(pipe("שלום"))

הרישיון

רישיון CC-BY-4.0 מאפשר שימוש מסחרי חופשי, שינוי של המודל ושילוב שלו במוצרים סגורים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים מאוניברסיטת הלסינקי, בלי להוסיף הגבלות משפטיות שמונעות מאחרים לעשות מה שהרישיון המקורי מתיר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗