GPT
O

opus-mt-zh-en

קוד פתוח

Helsinki-NLPcc-by-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • marian

פתרון ייעודי קל משקל שמתרגם מסינית לאנגלית בלי תלות ברשת. הוא מתאים למי שרוצה ביצועים מהירים בעלויות אפסיות ומוכן לוותר על הבנת הקשר מורכב.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 171,458הורדות בחודש
  • 558לייקים

מה זה

מדובר במודל תרגום מבוסס MarianMT עם 6 שכבות בלבד, שנועד לעבודה ישירה מצמד השפות סינית לאנגלית. הוא אומן על מאגר OPUS הפתוח ומיועד למשימות תרגום נקודתיות דרך ספריית transformers, בלי המשקל העודף של מודלי שפה ענקיים שדורשים חומרה יקרה.

במדדי ההערכה על סט הבדיקה של Tatoeba הוא קיבל ציון BLEU של 36.1 ומדד chr-F של 0.548, עם מקדם אורך של 0.948. המספרים האלה מראים שהוא מייצר תרגום סביר ומובן למשפטים יומיומיים או ברורים, אבל הוא לא מתחרה ברמת הדיוק או בניואנסים של מודלים מודרניים גדולים פי כמה.

מתאים ל

  • תרגום הודעות ופידבקים

    תרגום מהיר של טקסטים קצרים ממשתמשים מסינית לאנגלית בצד השרת.

  • עיבוד מקדים למידע גולמי

    המרה בסיסית של נתונים ממאגרים בסינית כדי לאפשר חיפוש באנגלית.

  • ריצה מקומית ללא רשת

    שילוב בתוך סביבות סגורות שבהן אסור להוציא מידע ל־API חיצוני.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו או יאבדו רצף. מעבר לזה, הכרטיס מזהיר במפורש מפני הטיות, סטריאוטיפים ותכנים פוגעניים שהמודל עלול לשחזר ישירות ממאגרי האימון שלו ברשת.

הוא עובד רק בכיוון אחד, מסינית לאנגלית, ולא מכיר עברית בכלל. לפני שמשלבים אותו בזרימת מידע אמיתית, חייבים לבדוק ידנית איך הוא מתמודד עם שמות, סלנג ומונחים מקצועיים מתחום הפעילות שלכם.

שאלות
נפוצות

האם הוא מסוגל לתרגם מאנגלית לסינית?

לא. המודל אומן ספציפית לכיוון אחד מסינית לאנגלית בלבד, ואי אפשר להפוך את כיוון העבודה שלו בלי מודל אחר.

כמה זיכרון עבודה נדרש כדי להריץ אותו בייצור?

הקבצים שוקלים 1.1 ג'יגה בייט, כך שפחות מ־2 ג'יגה בייט זיכרון RAM יספיקו לטעינה ולהסקה. אין צורך בכרטיס מסך כדי לקבל זמני מענה סבירים.

איך מריצים

טוענים אותו ישירות דרך AutoModelForSeq2SeqLM ו־AutoTokenizer מקוד פייתון רגיל. עם משקל כולל של 1.1 ג'יגה בייט, לא צריך GPU ייעודי והוא ירוץ בלי בעיה גם על מעבד רגיל בשרת זול או במחשב פיתוח מקומי.

אם אתם צריכים לתרגם כמויות גדולות של פסקאות קצרות ברקע, שווה להרים אותו עצמאית ולחסוך עלויות תעבורה. מצד שני, אם אתם צריכים לתרגם מסמכים טכניים ארוכים או טקסט ספרותי, עדיף לקרוא ל־API מסחרי חזק יותר ולא לנסות לסחוט תוצאות מורכבות ממודל בגודל הזה.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-zh-en")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של המשקלים בתוך מוצר, כל עוד נותנים קרדיט מתאים לחוקרים מאוניברסיטת הלסינקי ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗