GPT
N

nllb-200-1.3B

קוד פתוח

facebookcc-by-nc-4.02022-07-08

  • transformers
  • pytorch
  • m2m_100
  • text2text-generation
  • nllb

מודל תרגום ישיר בין מאתיים שפות שנבנה במיוחד עבור שפות דלות משאבים. הוא רלוונטי למי שצריך תרגום מקומי שלא עובר קודם דרך אנגלית.

  • 1,024טוקנים בהקשר
  • 5.1 GBמשקל הקבצים
  • 47,342הורדות בחודש
  • 75לייקים

מה זה

מדובר במודל ייעודי לתרגום מכונה מבית פייסבוק, המבוסס על ארכיטקטורת M2M100 עם עשרים וארבע שכבות. בניגוד לרוב מודלי השפה הכלליים בגודל הזה שמנסים לכתוב קוד או לנהל שיחה, הוא עושה דבר אחד בלבד: מקבל משפט בשפה אחת ופולט אותו בשפה אחרת מתוך מאגר של מאתיים שפות נתמכות.

האימון נעשה על שילוב של טקסטים מקבילים ומאגרי מידע מבוססי Common Crawl, כשהבדיקות של המפתחים התבססו על מדדי BLEU, spBLEU ו־chrF++ מול סט הנתונים Flores-200, לצד הערכות אנושיות ובדיקות רעילות. המטרה כאן הייתה להביא שפות עם מעט מאוד מידע ברשת, בדגש על שפות אפריקאיות וניבים מקומיים, לרמת תרגום שמישה ישירות בין שפה לשפה בלי תיווך.

מתאים ל

  • מחקר אקדמי בתרגום מכונה

    השוואת ביצועים ואיכות תרגום ישיר בשפות נדירות ללא תלות באנגלית כשפת מעבר.

  • תרגום טקסטים קצרים לחוקרים

    עיבוד מקומי של משפטים בודדים מתוך מאגרי מידע ביותר ממאתיים שפות שונות.

  • עיבוד נתונים לא מקוון

    תרגום מקומי של מידע רגיש שאי אפשר להוציא לרשת, בפרויקטים שאינם מסחריים.

איפה זה נופל

הכרטיס מגדיר בבירור שהמודל אומן על משפטים קצרים שלא עולים על 512 טוקנים, ולכן הזנת פסקאות ארוכות או מסמכים שלמים תוביל לירידה מהירה באיכות התרגום. בנוסף, האימון התמקד בטקסט כללי ונבדק בעיקר על ויקימדיה, כך שהוא לא מתאים לטקסטים רפואיים, משפטיים או תרגומים רשמיים שדורשים דיוק מוחלט. יש גם סיכון ממשי לתרגומי שגיאה שיכולים להטעות, והחוקרים עצמם מזהירים מפני שימוש בו בסביבות ייצור קריטיות.

אותה משפחה

nllb-200 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לתרגם מסמכים שלמים ברצף?

לא, הוא מיועד למשפטים בודדים ואומן על קלטים קצרים מעל 512 טוקנים. אם תזינו לתוכו מסמך שלם האיכות תיפגע באופן משמעותי, ולכן תצטרכו לחתוך את הטקסט למשפטים בעצמכם לפני השליחה.

אפשר להטמיע אותו באפליקציה מסחרית שמוכרת מנויים?

ממש לא. הרישיון של פייסבוק הוא CC-BY-NC 4.0 שמונע במפורש כל שימוש מסחרי מכל סוג. הוא מיועד למחקר בלבד, ולשימוש מסחרי תצטרכו לחפש מודל עם רישיון פתוח לחלוטין.

איך מריצים

המודל שוקל 5.1 גיגהבייט ונטען דרך ספריית transformers הרגילה של פייתון. בדיוק המקורי של float32 הוא דורש כרטיס מסך עם לפחות 6 עד 8 גיגהבייט זיכרון כדי לבצע היקש בצורה יציבה, או כרטיס קטן יותר אם ממירים אותו לדיוק נמוך יותר.

אם אתם צריכים לתרגם רק כמה עשרות משפטים פה ושם בשפות נפוצות, החזקה של שרת ייעודי עבורו מיותרת לגמרי ועדיף להשתמש בשירות קיים. ההרצה העצמאית משתלמת רק כשעובדים עם נפחי תרגום גדולים, כשיש דרישה לפרטיות מוחלטת של המידע, או כשעובדים עם צמדי שפות נדירים ששירותים מסחריים רגילים לא מציעים.

from transformers import pipeline

pipe = pipeline("translation", model="facebook/nllb-200-1.3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה לשום מטרה מסחרית. מותר להוריד אותו, לשנות אותו ולהריץ אותו לצורכי מחקר, בדיקות או פיתוחים פנימיים לא מסחריים בלבד. אם אתם בונים מוצר שנועד לייצר הכנסה או מוטמע באפליקציה עסקית, אתם לא יכולים להשתמש במשקלים האלה כחוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗