GPT
F

fugumt-en-ja

קוד פתוח

stakacc-by-sa-4.02022-05-08

  • transformers
  • pytorch
  • marian
  • text2text-generation
  • translation

תרגום מאנגלית ליפנית במודל זעיר שלא דורש שרת ייעודי. פתרון ממוקד למי שרוצה להריץ תרגום מקומי בלי לשלם על מודלי ענק.

  • 512טוקנים בהקשר
  • 118 MBמשקל הקבצים
  • 3,475הורדות בחודש
  • 54לייקים

מה זה

מדובר במודל תרגום מאנגלית ליפנית שמבוסס על ארכיטקטורת מריאן הוותיקה. הוא עושה דבר אחד בלבד, בלי יכולות שיחה או הבנת הנחיות, והוא שוקל 118 מגה בייט בלבד. הגודל הזה הופך אותו לפתרון קל מאוד לפריסה, במיוחד ביחס למודלים מודרניים שדורשים גיגה בייטים של זיכרון כדי לבצע פעולה בסיסית דומה.

בבדיקה שפורסמה בכרטיס על 500 משפטים ממאגר טטואבה, הוא קיבל ציון בלו של 32.7 עם חלוקה למילים באמצעות מכאב. הציון הזה אומר שהוא מסוגל להפיק משפטים ברורים ותקינים ברמת היומיום, אבל המדד נבדק על משפטים קצרים ופשוטים יחסית. אל תצפו ממנו להתמודד בעצמו עם טקסטים ספרותיים עמוסים, סלנג מורכב או הקשר תרבותי רחב בלי עריכה אנושית.

מתאים ל

  • תרגום ממשקי תוכנה

    מתאים לתרגום מחרוזות קצרות באפליקציות מאנגלית ליפנית, ישירות על המכשיר או במעבד חלש.

  • לוקליזציה של הודעות

    תרגום התראות ומיילים קבועים בתהליכי אוטומציה בלי לשלוח מידע לספק חיצוני.

  • עיבוד מקדים לחיפוש

    המרת שאילתות חיפוש ממשתמשים באנגלית לקטלוג מוצרים שמתוייג ביפנית בלבד.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים ותרגום בכיוון אחד בלבד, מאנגלית ליפנית, כך שהוא לא יודע להחזיר אנגלית מיפנית. מעבר לזה, המודל אינו מיועד לפסקאות שלמות ברצף, ואם תזרקו עליו טקסט לא מחולק הוא יאבד את הקשר או יחתוך חלקים. ציון הבדיקה מבוסס על מדגם קטן מאוד של 500 משפטים בלבד, מה שלא נותן תמונה מלאה על ביצועים בנישות מקצועיות כמו רפואה או משפטים.

שאלות
נפוצות

האם המודל יודע לתרגם גם מיפנית לאנגלית?

לא. הוא אומן אך ורק בכיוון של אנגלית ליפנית. אם תנסו להזין לו יפנית, תקבלו פלט שגוי או חסר משמעות.

למה כדאי להשתמש בו במקום במודל שפה גדול?

הוא שוקל רק 118 מגה בייט ורץ במהירות על כל מעבד בסיסי. מודלי שפה גדולים יקרים בהרבה להרצה ודורשים משאבים מוגזמים למשימה פשוטה כזו.

איך מריצים

טוענים אותו ישירות דרך פייפליין של טרנספורמרס בצירוף סנטנספיס, בשתי שורות קוד בפייתון. בגלל המשקל הקטן והעובדה שיש לו שש שכבות בדיוק של חצי דיוק, אפשר להריץ אותו בלי שום בעיה על מעבד רגיל, בלי כרטיס גרפי ובלי לצרוך כמעט זיכרון עבודה.

אם אתם צריכים לתרגם טקסטים ארוכים, הכרטיס ממליץ לפצל אותם למשפטים מראש בעזרת ספריה כמו פאי אס בי די. שווה להחזיק אותו מקומית אם יש לכם זרם רציף של משפטים קצרים ואתם רוצים לחסוך עלויות תעבורה, אבל אם אתם צריכים לתרגם פעם בשבוע מסמך שלם, עדיף להשתמש בבוט או שירות חיצוני קיים.

from transformers import pipeline

pipe = pipeline("translation", model="staka/fugumt-en-ja")
print(pipe("שלום"))

הרישיון

הרישיון הוא סי סי ביאי אס אי 4.0. מותר להשתמש בו לצרכים מסחריים, אבל חובה לתת קרדיט ליוצר המקורי. בנוסף, אם שיניתם את המודל או אימנתם אותו הלאה, אתם חייבים להפיץ את הנגזרת תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗