GPT
O

opus-mt-ko-en

קוד פתוח

Helsinki-NLPapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • marian
  • text2text-generation

תרגום פשוט מקוריאנית לאנגלית שרץ מקומית בלי לגעת בענן. הוא שוקל פחות מגיגהבייט ומתאים למי שחייב לעבד טקסטים מהר ובפרטיות מוחלטת.

  • 512טוקנים בהקשר
  • 599 MBמשקל הקבצים
  • 274,403הורדות בחודש
  • 68לייקים

מה זה

מדובר במודל ייעודי לתרגום מקוריאנית לאנגלית שמבוסס על ארכיטקטורת MarianMT עם 6 שכבות בלבד. המשקל הכולל של הקבצים עומד על כמעט 600 מגהבייט, מה שהופך אותו לקל משקל ביחס למודלים מודרניים. הוא לא מנסה לחשוב, לנמק או לנהל שיחה, אלא מקבל טקסט בשפת המקור ומחזיר תרגום לאנגלית דרך טוקנייזר SentencePiece של 32 אלף מונחים.

במבחן Tatoeba הוא הוציא ציון BLEU של 41.3 ומדד chr-F של 0.588. המספרים האלה מראים ביצועים סבירים מאוד למשפטים קצרים ויומיומיים, אבל צריך לזכור שסט הבדיקה של Tatoeba מורכב מדוגמאות פשוטות יחסית, כך שהתוצאה הזו לא מעידה בהכרח על הצלחה עם שפה טכנית מורכבת או סלנג עכשווי.

מתאים ל

  • תרגום תגובות ופורומים

    מאפשר לעבד במהירות ובזול כמויות גדולות של הודעות קצרות מקוריאנית לצורך ניטור תוכן.

  • עיבוד מידע פנימי במחשב

    רץ מקומית על המעבד בלי להוציא מידע רגיש לשרתים חיצוניים ובלי עלויות שימוש.

  • שלב ראשון בצינור נתונים

    ממיר טקסט קוריאני לאנגלית פשוטה לפני שליחה למודלים אחרים שמבינים רק אנגלית.

איפה זה נופל

הקשר הקלט מוגבל ל־512 טוקנים בלבד, מה שאומר שהוא לא מסוגל להתמודד עם מסמכים ארוכים ברצף ודורש חיתוך ידני של הטקסט למשפטים. בנוסף, הוא אומן ביוני 2020 על מאגרים ספציפיים, כך שהוא מתקשה עם מונחים מודרניים, סלנג רשת קוריאני או הקשר תרבותי עמוק. מי שינסה להזין לו מסמך משפטי או רפואי עלול לקבל תרגום מילולי מדי שמאבד את הכוונה המקורית.

שאלות
נפוצות

האם חייבים כרטיס מסך כדי להשתמש בו?

לא. המודל שוקל 599 מגהבייט ומכיל 6 שכבות בלבד, כך שכל מעבד מודרני מריץ אותו במהירות מצוינת בלי צורך בחומרה ייעודית.

האם הוא מתאים לתרגום ספרים או מאמרים ארוכים?

לא מומלץ. מגבלת הזיכרון של 512 טוקנים והאימון על משפטים מבודדים גורמים לו לאבד הקשר בין פסקאות ולהפיק תרגום מקוטע.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות MarianMTModel. בגלל הגודל המזערי, אפשר להריץ אותו בלי שום בעיה על מעבד רגיל של מחשב נייד או שרת פשוט, בלי להזדקק למעבד גרפי יקר או לזיכרון עבודה מיוחד.

אם אתם צריכים לתרגם מיליוני עמודים של מסמכים מורכבים או פסקאות ספרותיות, API מסחרי ייתן תוצאה קולחת יותר ויחסוך תחזוקה. המודל הזה משתלם כשרוצים להרים שירות פנימי, לחסוך עלויות ענן שוטפות, או לשמור על המידע בתוך הרשת המקומית.

from transformers import pipeline

pipe = pipeline("translation", model="Helsinki-NLP/opus-mt-ko-en")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗