GPT
O

opus-mt-tc-big-tr-en

קוד פתוח

Helsinki-NLPcc-by-4.02022-04-13

  • transformers
  • pytorch
  • tf
  • safetensors
  • marian

המודל מתרגם מטורקית לאנגלית בלי תלות בשירותי ענן חיצוניים. הוא שוקל פחות משני ג'יגה ומתאים למי שחייב עיבוד מקומי ומהיר.

  • 235Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 152,937הורדות בחודש

מה זה

מדובר במודל תרגום ייעודי מטורקית לאנגלית מסדרת פרויקט OPUS-MT. הוא אומן במקור על Marian NMT בסביבת C++ והומר לפייתורץ' עבור ספריית transformers. עם 235 מיליון פרמטרים וארכיטקטורת transformer-big, הוא מתמקד כולו במשימה אחת בלבד במקום לנסות לדעת הכל כמו מודלי שפה כלליים.

במבחני הביצועים הוא מציג ציון BLEU של 57.6 על מאגר tatoeba, שזה נתון חזק מאוד למשפטים קצרים ומובנים. מצד שני, במבחני חדשות מורכבים כמו newstest2016 עד 2018 הציון יורד סביב 29 עד 30, ועל flores101 הוא מגיע ל־37.6. המספרים האלה מראים שבטקסט יומיומי הוא עובד טוב, אבל במאמרים מורכבים או שפה עיתונאית צפופה הוא מאבד דיוק ועלול לייצר תרגום מילולי מדי.

מתאים ל

  • תרגום הודעות וצ'אטים

    משקל קל וריצה מקומית מהירה שמתאימים למשפטים יומיומיים קצרים מטורקית.

  • ניתוח פידבקים ותגובות

    מאפשר לעבד כמויות גדולות של ביקורות גולשים בלי לשלם לפי קריאה לשירות ענן.

  • צינורות עיבוד נתונים

    מתאים לשילוב כשלב הכנה באנגלית בתוך מערכות סיווג או שליפת מידע.

איפה זה נופל

הוא מוגבל לחלון הקשר של 1,024 טוקנים, כך שהוא לא בנוי לתרגום של מסמכים שלמים במכה אחת אלא למשפטים או פסקאות קצרות. בנוסף, הכיוון הוא חד-כיווני, רק מטורקית לאנגלית, ואין לו שום תמיכה בעברית או בכיוון ההפוך. נפילת הציונים בטקסטים עיתונאיים דורשת בדיקה קפדנית אם אתם בונים על תרגום של תוכן מקצועי או ספרותי.

שאלות
נפוצות

אפשר לתרגם איתו מאנגלית לטורקית?

לא. המודל אומן לכיוון אחד בלבד, מטורקית כשפת מקור לאנגלית כשפת יעד. אם תזינו לו אנגלית תקבלו פלט משובש.

הוא יכול לרוץ על שרת ללא GPU?

כן. עם 235 מיליון פרמטרים, מעבד מודרני ממוצע מריץ אותו במהירות טובה מאוד לפסקאות קצרות. כרטיס גרפי נחוץ רק אם יש עומס של אלפי בקשות במקביל.

איך מריצים

טוענים אותו ישירות דרך transformers עם MarianTokenizer ו־MarianMTModel, או דרך pipeline של תרגום בשתי שורות קוד. הקבצים שוקלים 1.8 ג'יגה ב־14 קבצים, והמשקלים שמורים בפורמט float16.

בגלל הגודל הצנוע שלו הוא רץ בקלות על מעבד רגיל בשרת פשוט, ולא דורש מאיץ גרפי יקר כדי לתת זמני תגובה טובים. אם יש לכם כרטיס מסך בסיסי עם 4 ג'יגה זיכרון, הוא יישב שם בלי בעיה. שווה להריץ אותו לבד אם אתם מעבדים נפחי טקסט גדולים שבהם תשלום לפי טוקן ב־API חיצוני יהיה יקר מדי, או כשיש דרישות פרטיות ואסור למידע לצאת מהתשתית שלכם.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-tc-big-tr-en")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר שלכם. התנאי היחיד הוא מתן קרדיט ברור לפרויקט OPUS-MT ולחוקרים מאוניברסיטת הלסינקי שפרסמו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗