GPT
M

Multilingual-MiniLM-L12-H384

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

פתרון קל ומהיר לסיווג טקסט רב לשוני, שמציג ביצועים קרובים למודלים כבדים בהרבה אך דורש רק 21 מיליון פרמטרי טרנספורמר. הבחירה המתאימה למי שחייב שיהוי נמוך בכמה שפות בלי שרתים מנופחים.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 62,209הורדות בחודש
  • 110לייקים

מה זה

מיקרוסופט לקחה את הרעיון של זיקוק מודלים ויצרה גרסה מוקטנת משמעותית שתומכת בריבוי שפות. המודל בנוי על ארכיטקטורת ברט עם 12 שכבות וגודל נסתר של 384, אך משתמש בטוקנייזר של אקס אל אם רוברטה. בזכות שילוב של 21 מיליון פרמטרים בטרנספורמר ו־96 מיליון בשכבת השיבוץ, הוא קל מאוד ביחס לחלופות.

במבחני הסקת מסקנות רב לשוניים הוא השיג ממוצע של 71.1 נקודות, תוצאה שעוקפת את מודל ברט הרב לשוני של גוגל ומפגרת במעט בלבד אחרי מודל הבסיס המלא שמכיל פי ארבעה יותר פרמטרים. במענה לשאלות הוא הציג ציון אפ אחד ממוצע של 63.2 נקודות, מה שמראה שדחיסת המשקלים כמעט לא פגעה ביכולת ההבנה שלו באנגלית, ערבית, ספרדית ושפות נוספות שנבדקו.

מתאים ל

  • סיווג כוונות בשיחה

    זיהוי מהיר של כוונת המשתמש בכמה שפות שונות, בלי עיכוב שפוגע בזמן התגובה של הצ'אט.

  • סינון תוכן בזמן אמת

    סיווג פוסטים והודעות קצרות בערבית או באנגלית על גבי שרת מקומי חסכוני במשאבים.

  • שליפת תשובות קצרות

    התאמת שאלות למאגרי ידע על בסיס ביצועים חזקים במבחני שאלות ותשובות רב לשוניים.

איפה זה נופל

הטוקנייזר של אקס אל אם רוברטה גורם לבעיית תאימות ישירה. אי אפשר לקרוא לו דרך המחלקה האוטומטית הרגילה בספריה, וחובה להגדיר אותו ואת המודל ידנית לפי הדוגמה של מיקרוסופט. מעבר לכך, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו. למרות התמיכה במגוון שפות רחב, עברית אינה מופיעה בפירוט המדדים המוצג בכרטיס, מה שמחייב בדיקה מעשית של איכות הפירוק והסיווג לפני שמשלבים אותו במערכת מקומית.

שאלות
נפוצות

למה הטעינה נכשלת עם שגיאה כשאני משתמש בטוקנייזר האוטומטי?

המודל משלב שכבות של ברט עם מפענח טוקנים שמקורו במודל רוברטה. כדי לטעון אותו בהצלחה יש לקרוא ישירות למחלקה המתאימה של אקס אל אם רוברטה ולא להסתמך על הזיהוי האוטומטי.

האם הוא מתאים לטקסטים ארוכים כמו מאמרים או חוזים?

לא. המודל מוגבל לעד 512 טוקנים, ולכן הוא לא בנוי לטפל במסמכים שלמים בלי לחתוך אותם מראש או לחלק אותם לחלקים קטנים.

איך מריצים

המודל שוקל 1.3 גיגה בייט ומיועד לריצה בספריית טרנספורמרס. בגלל המבנה הקומפקטי שלו אפשר להריץ אותו בקלות על כל מעבד מודרני בלי להשקיע במאיץ גרפי ייעודי, או להעמיס אותו על כרטיס מסך בסיסי ולקבל זמני תגובה זניחים בתוך תהליך קיים.

אין סיבה לשלם לספקי שירות ענן חיצוניים על קריאות שרת עבור משימות סיווג פשוטות כשיש מודל בגודל כזה. שווה להקים תשתית פנימית בעלות מינימלית, אך חייבים לשים לב לקוד ההרצה: המודל דורש הגדרה ידנית של הטוקנייזר ולא נטען באופן תקין דרך מנגנון הזיהוי האוטומטי הרגיל.

from transformers import pipeline

pipe = pipeline("text-classification", model="microsoft/Multilingual-MiniLM-L12-H384")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון אם איי טי חופשי ופתוח. הרישיון מאפשר שימוש מסחרי מלא, שינוי הקוד, אימון נוסף ושילוב המודל בכל מוצר פנימי או מסחרי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ומלל הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗