GPT
N

nllb-200-distilled-1.3B

קוד פתוח

facebookcc-by-nc-4.02022-07-08

  • transformers
  • pytorch
  • m2m_100
  • text2text-generation
  • nllb

פתרון ייעודי לתרגום ישיר בין מאתיים שפות, שמתמקד גם בשפות מעוטרות משאבים. הוא מציע דיוק של מודל ענק באריזה מזוקקת שמתאימה למי שצריך תרגום מקומי בלי מודל שפה כללי כבד.

  • 1,024טוקנים בהקשר
  • 5.1 GBמשקל הקבצים
  • 293,440הורדות בחודש
  • 185לייקים

מה זה

הפרויקט הזה של פייסבוק נבנה למטרה אחת בלבד: תרגום מכונה ישיר בין מאתיים שפות שונות, בלי לעבור דרך אנגלית כשפת ביניים. הגרסה הזו עברה זיקוק מגרסאות גדולות יותר לנפח של 1.3 מיליארד פרמטרים, כך שהיא מנסה לשמר את היכולות של המודלים המלאים בתוך קבצים של כחמישה גיגה-בייט.

בניגוד למודלי שפה כלליים שיודעים לכתוב קוד או לענות על שאלות ועל הדרך גם מתרגמים, כאן מדובר בארכיטקטורת תרגום ייעודית. החוקרים בדקו אותו במדדי תרגום מקובלים כמו BLEU ו־chrF++ מול מאגר Flores-200, כולל הערכות אנושיות ובדיקות רעילות לפלט. המשמעות בשטח היא פוקוס חזק על דיוק תחבירי וכיסוי רחב של דיאלקטים ושפות נדירות, במיוחד מאפריקה, שרוב הכלים הגדולים פשוט מפספסים או מעוותים לחלוטין.

מתאים ל

  • תרגום משפטים לשפות נדירות

    כיסוי של מאתיים שפות בדיוק גבוה, כולל שפות מקומיות שאינן נתמכות במודלים רגילים.

  • מחקרי בלשנות ותרגום מכונה

    סביבת עבודה נוחה למחקר אקדמי שמשווה איכות תרגום על מאגר Flores-200.

  • עיבוד טקסט אוף-ליין

    הרצה מקומית על שרת מבודד ללא תלות בחיבור לרשת או בספקי ענן חיצוניים.

איפה זה נופל

פייסבוק מגדירים את המודל הזה ככלי מחקרי בלבד, והוא לא מיועד לפרודקשן. האימון נעשה על טקסטים קצרים עד 512 טוקנים, ולכן הזנת פסקאות ארוכות או מסמכים שלמים תגרור ירידה חדה באיכות התרגום. הוא מיועד למשפטים בודדים מטקסט כללי, ולא מתאים לטקסטים מקצועיים ברפואה או במשפטים. מעבר לזה, המפתחים מזהירים מפני טעויות תרגום שעלולות להיות מסוכנות, ומציינים שסינון המידע האישי מהאינטרנט לא היה מושלם.

אותה משפחה

nllb-200 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לתרגם איתו מסמכים שלמים או קבצי PDF?

לא, הוא לא מיועד לזה. האימון שלו הוגבל לטקסטים קצרים של עד 512 טוקנים, והרצה של טקסטים ארוכים תפגע קשות באיכות התרגום. בשביל מסמכים תצטרכו לחתוך את הטקסט למשפטים בודדים לפני השליחה.

האם אפשר להשתמש במודל הזה בתוך אפליקציה מסחרית?

לא, הרישיון אוסר על כך במפורש. מדובר ברישיון CC-BY-NC שמגביל את השימוש למחקר ולמטרות לא מסחריות בלבד, כך שלא ניתן לבנות עליו שירות בתשלום.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית transformers. הקבצים שוקלים 5.1 גיגה-בייט בפורמט float32, מה שאומר שתצטרכו כרטיס מסך עם לפחות 6 עד 8 גיגה זיכרון וידאו כדי לעבוד בצורה יציבה, או מעבד חזק עם מספיק זיכרון פנימי אם אתם מוכנים לספוג זמני ריצה ארוכים יותר.

ההבדל העיקרי מול גרסאות אחרות בסדרה הוא שמדובר בגרסה מזוקקת וקומפקטית יחסית למשקלי הענק המקוריים. אם המטרה היא להריץ תרגום פנימי בתוך שרת פרטי או בסביבה ללא רשת, ההרצה הזו מעשית מאוד. אם יש לכם צורך בתרגום מזדמן של כמה פסקאות בלבד ולא רוצים לנהל תשתית, עדיף להשתמש בפתרון ענן קיים.

from transformers import pipeline

pipe = pipeline("translation", model="facebook/nllb-200-distilled-1.3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות ברורה וחד משמעית: השימוש מותר למטרות מחקר, לימוד ופיתוח לא מסחרי בלבד. אסור לשלב אותו במוצר שמניב הכנסות, בשירות בתשלום או בפעילות עסקית מסחרית כלשהי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗