GPT
N

nllb-200-distilled-600M

קוד פתוח

facebookcc-by-nc-4.02022-07-08

  • transformers
  • pytorch
  • m2m_100
  • text2text-generation
  • nllb

גרסה מזוקקת וקומפקטית לתרגום בין מאתיים שפות, שמתאימה למי שרוצה להריץ תרגום מקומי בלי להחזיק שרת יקר או להסתמך על רשת חיצונית.

  • 1,024טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 1,465,753הורדות בחודש
  • 970לייקים

מה זה

מדובר במודל ייעודי לתרגום מכונה מבית פייסבוק, שמכיל 12 שכבות ומבוסס על ארכיטקטורת M2M-100. המטרה המרכזית שלו היא גישור על פערים בשפות עם מעט מאוד משאבים ברשת, לצד השפות הגדולות. הוא נבנה מראש כדי לתרגם ישירות בין כל זוג שפות מתוך המאתיים, בלי לעבור קודם דרך אנגלית, תוך שימוש בטוקנייזר מסוג SentencePiece.

הייחוד בגרסה הזו הוא הזיקוק. לקחו את הידע של מודל ענק ודחסו אותו לנפח קבצים של 2.3 גיגה בייט בלבד. במקום מודל כבד שמחייב חומרה ייעודית מורכבת, מקבלים נקודת עבודה קלה בהרבה שמתאימה לתרגום משפטים בודדים ממאגרי טקסט כלליים.

מתאים ל

  • מחקר בתרגום חישובי

    התנסות ובדיקת איכות תרגום בין צמדי שפות נדירות על גבי מאגר Flores-200.

  • תרגום מקומי אופליין

    עיבוד משפטים בודדים ללא תלות ברשת ועל חומרה צנועה שאינה דורשת משאבים כבדים.

  • סינון וסיווג טקסט רב לשוני

    תרגום מקדים ומהיר של שורות קצרות מתוך מאתיים שפות לצורך ניתוח פנימי.

איפה זה נופל

המודל מיועד אך ורק למשפטים בודדים. אף על פי שחלון ההקשר עומד על 1,024 טוקנים, המפתחים מצהירים שהאימון נעשה על קלטים שלא עולים על 512 טוקנים, ולכן הזנת רצפים ארוכים תפגע באיכות התרגום באופן מיידי. הוא לא נבנה לתרגום מסמכים שלמים.

בנוסף, הטקסטים ששימשו לאימון הגיעו בעיקר מהרשת הכללית ומבדיקות על תכני ויקימדיה. המודל אינו מתאים לטקסטים רפואיים, משפטיים או מקצועיים, ופייסבוק מדגישה במפורש שהוא לא נועד להפצה בסביבות ייצור ולא יכול לשמש כתרגום רשמי. עשויים להופיע גם תרגומים שגויים או מידע אישי שלא נוקה עד הסוף ממקורות הרשת.

אותה משפחה

nllb-200 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לתרגום קבצים ומסמכים שלמים?

לא. המודל אומן על משפטים בודדים באורך של עד 512 טוקנים, ואינו מיועד להבנת הקשר רחב של מסמך מלא. ניסיון להזין טקסטים ארוכים יוביל לירידה מהירה באיכות התוצאה.

האם מותר לשלב אותו באפליקציה מסחרית שגובה כסף?

בשום אופן לא. הרישיון המוגדר הוא CC-BY-NC 4.0, שפוסל במפורש שימוש מסחרי מכל סוג שהוא ומגביל את המודל למטרות מחקר בלבד.

איך מריצים

המשקל הכולל יושב על 2.3 גיגה בייט בפורמט float32, מה שאומר שאפשר לטעון ולהריץ אותו בקלות בספריית transformers על כרטיס מסך בסיסי או אפילו על מעבד רגיל במחשב פיתוח. אם יש לכם שרת מקומי קטן ואתם צריכים תרגום שרץ בלי תלות בחיבור חיצוני או בלי לשלם לפי קריאה, ההרצה העצמית הזו הגיונית מאוד.

מצד שני, אם אתם צריכים לתרגם פסקאות ארוכות, מסמכים שלמים או טקסטים מקצועיים, עדיף לפנות למודלים גדולים יותר או לשירותי תרגום מנוהלים. המודל הזה מתאים בעיקר לתשתיות עצמאיות שמתמקדות בעיבוד משפטים קצרים בלבד.

from transformers import pipeline

pipe = pipeline("translation", model="facebook/nllb-200-distilled-600M")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC-BY-NC 4.0, מה שאומר שאסור להשתמש במודל לשום מטרה מסחרית. מותר להשתמש בו למחקר, ניסויים פנימיים ובדיקות טכנולוגיות, תוך מתן קרדיט מתאים. אם אתם בונים מוצר שנועד למכירה או לחברה מסחרית, אי אפשר להטמיע את המודל הזה בקוד שלכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗