GPT
N

nllb-200-3.3B

קוד פתוח

facebookcc-by-nc-4.02022-07-08

  • transformers
  • pytorch
  • m2m_100
  • text2text-generation
  • nllb

תרגום ישיר בין מאתיים שפות, עם דגש חזק על שפות בלי הרבה דאטה ברשת. פתרון מעניין למי שצריך תרגום ייעודי מחוץ לטקסטים השגרתיים באנגלית.

  • 1,024טוקנים בהקשר
  • 16.4 GBמשקל הקבצים
  • 188,439הורדות בחודש
  • 475לייקים

מה זה

מדובר במודל ייעודי לתרגום מכונה מבית פייסבוק, שנבנה על ארכיטקטורת M2M100 ומכסה מאתיים שפות שונות, כולל ניבים ייחודיים ושפות מעוטרות משאבים. הוא נועד לתרגם משפטים בודדים ישירות בין שפות שונות בלי לעבור דרך אנגלית כשפת ביניים, מה שמונע שחיקה במשמעות.

הבדיקות של פייסבוק נשענו על מדדי BLEU וגרסאותיו לצד הערכות אנושיות ובדיקות רעילות, בעיקר על סט הנתונים Flores-200. ההבדל בינו לבין מודלים כלליים בגודל הזה הוא המיקוד. במקום לנסות לכתוב קוד או לנהל שיחה, כל המשקל שלו מוקדש למעבר מדויק ממשפט למשפט על פני מגוון לשוני רחב.

מתאים ל

  • מחקר בלשני ותרגום מכונה

    הערכת תרגום ומחקר אקדמי על שפות מעוטות משאבים מתוך מאגר של 200 שפות.

  • תרגום משפטים בודדים

    עיבוד משפטים קצרים מחוץ לאנגלית שאינם דורשים הקשר של מסמך שלם.

  • סיווג וניתוח טקסט רב לשוני

    תרגום מהיר לצורכי מחקר פנימי של מאגרי מידע מגוונים מרחבי הרשת.

איפה זה נופל

הוא מיועד למשפטים קצרים בלבד ולא לתרגום מסמכים שלמים. פייסבוק מציינים במפורש שהאימון נעשה על קלטים של עד 512 טוקנים, ולכן טקסטים ארוכים יובילו לירידה חדה באיכות, למרות שחלון ההקשר עומד טכנית על 1,024.

בנוסף, הטקסטים ששימשו לאימון הם כלליים ומוויקימדיה. אסור להשתמש בו לתרגום רפואי, משפטי או תרגום רשמי מחייב, והיוצרים מזהירים מפני טעויות תרגום וחשש לזליגת מידע אישי שהיה קיים במאגרי הרשת שנאספו.

אותה משפחה

nllb-200 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי לתרגם מסמכים שלמים?

לא. המודל הוגדר ונבדק לתרגום משפטים בודדים, ואומן על קלטים שלא עולים על 512 טוקנים. מעבר לזה איכות הפלט יורדת בצורה משמעותית.

האם מותר להטמיע אותו במוצר של החברה שלי?

לא. הרישיון הוא לא מסחרי ונועד למטרות מחקר בלבד. שילוב שלו במוצר מסחרי מפר ישירות את תנאי השימוש שהגדירה פייסבוק.

איך מריצים

כדי להריץ אותו מקומית בספריית transformers תצטרכו להתמודד עם קבצים במשקל 16.4 גיגה בייט בדיוק float32, שמחולקים ל־12 קבצים. זה דורש כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי רק כדי לטעון אותו ולעבוד בלי קריסות.

אם אתם לא מחזיקים שרת ייעודי כזה פנוי או צריכים רק תרגומים בודדים מדי פעם, עדיף לפנות ל־API חיצוני. הרצה עצמית משתלמת רק כשאתם מעבירים נפח קבוע של משפטים במחקר פנימי ומערך החומרה כבר עומד לרשותכם.

from transformers import pipeline

pipe = pipeline("translation", model="facebook/nllb-200-3.3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שהוא סגור לחלוטין לכל שימוש מסחרי. מותר להשתמש בו לצורכי מחקר ופיתוח פנימיים בלבד, תוך מתן קרדיט מתאים. אם אתם בונים מוצר בתשלום או כלי מסחרי, המודל הזה פסול לחלוטין עבורכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗