GPT
M

m2m100_1.2B

קוד פתוח

facebookmit2022-03-02

  • transformers
  • pytorch
  • rust
  • m2m_100
  • text2text-generation

מודל תרגום ישיר שמחבר בין 100 שפות בלי לעבור דרך אנגלית באמצע. הוא שוקל מעל תשעה גיגה, עובד מקומית ומתאים למי שרוצה תרגום פרטי בלי להסתמך על רשת חיצונית.

  • 1,024טוקנים בהקשר
  • 9.2 GBמשקל הקבצים
  • 152,493הורדות בחודש
  • 205לייקים

מה זה

מדובר במודל שמבצע תרגום ישיר בין 100 שפות שונות בלי להמיר את הטקסט קודם לאנגלית, מה שמונע אובדן משמעות בתרגום בין שפות שאינן אנגלית, למשל מערבית לצרפתית או מרוסית לעברית. פייסבוק אימנו אותו לכסות 9,900 כיווני תרגום שונים בארכיטקטורת רצף לרצף עם עשרים וארבע שכבות.

רוב מודלי השפה הכלליים של היום מסוגלים לתרגם אבל דורשים כוח מחשוב עצום או פרומפטים מורכבים. כאן מקבלים מודל ייעודי למשימה אחת בלבד, שמקבל קלט בשפה אחת ומחזיר ישירות את הפלט בשפת היעד לפי מזהה שפה שמגדירים לו בטוקן הראשון. חלון ההקשר מוגבל לאלף עשרים וארבעה טוקנים, כך שהוא מיועד לפסקאות ומשפטים ולא לספרים שלמים.

היתרון הגדול שלו מול מודלים קטנים יותר מאותה משפחה הוא הדיוק העדיף שמגיע מנפח הפרמטרים, אבל זה מגיע עם תג מחיר של קבצים במשקל כולל של תשעה נקודה שניים גיגה בייט.

מתאים ל

  • תרגום שפות ישיר ללא אנגלית

    תרגום בין צמדי שפות כמו ספרדית לגרמנית בלי לעבור דרך אנגלית באמצע ובלי לאבד הקשר.

  • לוקליזציה פנימית במערכות סגורות

    תרגום טקסטים וממשקים בארגונים שאינם יכולים להוציא מידע לשירותי ענן חיצוניים.

  • עיבוד פסקאות בתוך צינור נתונים

    תרגום ישיר של תכנים קצרים עד 1,024 טוקנים כחלק מתהליך עיבוד שפה אוטומטי.

איפה זה נופל

חלון ההקשר עומד על 1,024 טוקנים בלבד, אז אי אפשר לזרוק אליו מסמכים ארוכים בבת אחת בלי לחתוך אותם קודם. בנוסף, חובה לנהל ידנית את מזהה שפת היעד בקוד, ואם שוכחים להגדיר אותו המודל יפלוט ג'יבריש או שפה לא נכונה. אין כאן מנגנון חשיבה או הבנת עולם כללית, אלא תרגום מכונה נטו.

אותה משפחה

m2m100 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

כן, עברית מופיעה ברשימת מאה השפות הנתמכות של המודל. אפשר לתרגם ישירות מעברית ואליה מכל אחת מתוך תשעים ותשע השפות האחרות.

למה הטוקנייזר זורק שגיאה בהרצה ראשונה?

הוא מתבסס על ספריית sentencepiece שלא מגיעה כברירת מחדל עם כל סביבה. התקנה פשוטה של החבילה דרך pip פותרת את הבעיה.

איך מריצים

כדי להריץ אותו דרך ספריית הטרנספורמרס צריך להתקין את חבילת סנטנספיס, אחרת הטוקנייזר ייכשל מיד בהרצה. בעבודה עצמה מעבירים את מזהה שפת היעד לתוך פרמטר ייעודי בזמן הגנרציה כדי לקבל את הפלט הנכון.

המשקל הכולל של עשרת הקבצים מגיע לתשעה נקודה שניים גיגה בייט, מה שאומר שצריך כרטיס מסך עם לפחות שנים עשר גיגה זיכרון כדי לטעון אותו ולעבוד בצורה סבירה. אם אין לכם חומרה כזו מקומית, עדיף להשתמש בפתרון ענן או במודל רזה יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/m2m100_1.2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון MIT. מדובר ברישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה בתוך מוצרים, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗