GPT
M

mbart-large-50

קוד פתוח

facebookmit2022-03-02

  • transformers
  • pytorch
  • tf
  • mbart
  • text2text-generation

מודל בסיס רב לשוני לתרגום ולמשימות טקסט בחמישים שפות, כולל עברית. הוא מתאים למי שרוצה לאמן בעצמו מודל מקומי בלי לשלם על שירותי ענן יקרים.

  • 1,024טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 71,170הורדות בחודש
  • 167לייקים

מה זה

מדובר במודל רצף לרצף עם 12 שכבות שמבוסס על אימון שחזור טקסט מחוק בחמישים שפות שונות. בניגוד לגרסה המוקדמת יותר שהחזיקה 25 שפות בלבד, כאן פייסבוק הרחיבו את התמיכה במקביל לעוד 25 שפות, כשהרשימה כוללת שפות כמו עברית, ערבית, רוסית ואנגלית.

הוא מיועד לשמש כבסיס שעליו עושים פיין טיונינג ולא כמודל מוכן שמייצר תרגומים ברגע ההורדה. השיטה שבה אימנו אותו כללה ערבוב סדר משפטים והסתרת 35 אחוזים מהמילים בטקסט המקורי, כדי ללמד אותו לייצר ייצוגים עמוקים של שפה לפני שמתאימים אותו למשימה מוגדרת.

מתאים ל

  • אימון מנוע תרגום פנימי

    משמש כבסיס יציב לאימון תרגום בין עברית לשפות אחרות בלי להתחיל מאפס.

  • סיכום טקסט רב לשוני

    מבנה ה־Seq2Seq מתאים לפיין טיונינג של משימות תמצות קצרות ב־50 שפות שונות.

  • תיקון ושחזור טקסטים

    האימון המקורי התמקד בהשלמת מילים חסרות ובסידור מחדש של משפטים משובשים.

איפה זה נופל

זהו מודל בסיס שטרם עבר כוונון לתרגום ישיר, ולכן הרצה שלו מהקופסה תייצר זבל או ניחושים עיוורים. מעבר לזה, חלון ההקשר מוגבל ל־1,024 טוקנים בלבד, כך שהוא לא בנוי למסמכים שלמים או לספרים אלא למשפטים ופסקאות קצרות בלבד. אם המטרה היא לקבל תרגום מיידי בלי לעבור שלב אימון נוסף עם נתונים משלכם, הדף הזה לא רלוונטי עבורכם.

שאלות
נפוצות

אפשר להוריד את המודל ולהתחיל לתרגם מיד?

לא. מדובר במודל בסיס שעבר אימון מקדים בלבד. כדי להשתמש בו לתרגום בפועל צריך לאמן אותו על זוגות משפטים מתורגמים, או לחפש גרסה שכבר עברה פיין טיונינג.

האם יש תמיכה מובנית בעברית?

כן, עברית מופיעה ברשימת 50 השפות הנתמכות תחת המזהה he_IL. הטוקנייזר כולל את המזהה הזה, אבל עדיין תצטרכו לאמן אותו על נתונים כדי לקבל תוצאות מדויקות.

כמה זיכרון צריך כדי לאמן אותו?

המשקל של המודל הוא 4.6 גיגה בייט, כך שלאימון בסיסי תצטרכו כרטיס עם לפחות 16 גיגה זיכרון גרפי, תלוי בגודל ה־batch שתבחרו. לחלופין אפשר להשתמש בשיטות כמו הקפאת שכבות כדי לחסוך במשאבים.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.6 גיגה בייט, מה שאומר שכרטיס מסך ביתי סביר עם 8 או 16 גיגה זיכרון יספיק כדי לטעון אותו ולאמן. ההרצה נעשית דרך ספריית transformers הרגילה של פייתון, יחד עם טוקנייזר ייעודי.

בזמן ההכנה לאימון חייבים להגדיר תחילית מזהה לשפת המקור ולשפת היעד, כמו he_IL לעברית, אחרת המודל פשוט לא יבין מה רוצים ממנו. אם אין לכם חומרה ייעודית או דאטה סט מסודר לאימון, להרים אותו לבד זה בזבוז זמן ועדיף לפנות לפתרונות מוכנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/mbart-large-50")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד המתירניים ביותר שיש. אפשר לקחת את המשקלים, לאמן עליהם, לשנות אותם ולשלב אותם במוצר מסחרי סגור בלי לשלם תמלוגים ובלי לפתוח את קוד המקור, כל עוד שומרים על הודעת זכויות היוצרים המקורית של פייסבוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗