GPT
M

mdeberta-v3-base

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • deberta-v2
  • deberta

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסה רב לשונית קומפקטית להבנת טקסט וסיווג, שמציגה ביצועי העברה מעולים מאנגלית לשפות אחרות. מיועדת למי שצריך אנליזה מדויקת בלי לתחזק מודלי ענק.

  • 512טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 4,318,079הורדות בחודש
  • 236לייקים

מה זה

מיקרוסופט לקחה את ארכיטקטורת DeBERTa V3 ואימנה אותה על דאטה רב לשוני של CC100 בהיקף של 2.5 טרה בייט. המבנה כולל 12 שכבות וגודל נסתר של 768, כאשר רוב המשקל יושב בכלל על שכבת ההטמעה. מתוך סך הפרמטרים, 190 מיליון שייכים לאוצר המילים העצום שמכיל 250 אלף טוקנים, ורק 86 מיליון מהווים את שלד המודל עצמו.

במבחני XNLI להעברה ישירה מאנגלית לשפות אחרות ללא אימון מקדים בהן, הוא עוקף את XLM-R בבסיס עם ממוצע של 79.8 לעומת 76.2. היתרון הזה נשמר בכל השפות שנבדקו, כולל ערבית, צרפתית וגרמנית. שיטת האימון בסגנון ELECTRA מאפשרת לו ללמוד ייצוגי שפה חדים בהרבה מאבותיו הוותיקים.

מתאים ל

  • סיווג טקסט רב לשוני

    אימון באנגלית בלבד מספק ביצועים גבוהים בשפות יעד אחרות לפי תוצאות XNLI.

  • זיהוי ישויות וניתוח תחבירי

    מנגנון תשומת הלב המשופר של DeBERTa מחלץ קשרים מורכבים בתוך טווח של 512 טוקנים.

  • מילוי מסיכות והשלמת מילים

    המשימה המקורית של המודל מאפשרת שחזור טוקנים חסרים במגוון שפות שנכללו באימון.

איפה זה נופל

חלון ההקשר קצר ועומד על 512 טוקנים בלבד, כך שהוא לא מתאים למסמכים ארוכים בלי חיתוך מוקדם. מעבר לזה, הכרטיס מציג בדיקות על שפות רבות אך עברית אינה מופיעה ברשימת השפות המפורטת או במבחני ההשוואה. חובה לבדוק את טיב הטוקניזציה והביצועים על טקסט עברי לפני שבונים עליו משהו בסביבת ייצור.

שאלות
נפוצות

האם המודל תומך בעברית ברמה טובה?

עברית לא מופיעה ברשימת השפות הראשית שנבדקה בכרטיס המודל. הוא אומן על CC100 שכולל עברית מסוימת, אך איכות ההבנה והטוקניזציה אינה מובטחת ודורשת בדיקה מעשית מצידכם.

למה שכבת ההטמעה גדולה כל כך ביחס לשאר המודל?

כדי לתמוך בעשרות שפות במקביל, אוצר המילים הורחב ל־250 אלף טוקנים. הרחבה זו דורשת 190 מיליון פרמטרים רק עבור מילון המונחים, פי שניים מכל שאר שכבות החישוב יחד.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.2 גיגה בייט, מה שאומר שתוכלו להריץ אותו בקלות על כרטיס מסך ביתי בודד או אפילו על מעבד לצורכי בדיקות. ספריית transformers נותנת תמיכה מובנית דרך משימת fill-mask או סקריפטים מוכנים לסיווג טקסט.

באימון עדין מלא מומלץ להשתמש בפיזור על כמה כרטיסים אם רוצים לסיים ריצות מהר, כמו בסקריפט ההדגמה שמריץ שמונה מעבדים גרפיים במקביל. כיוון שמדובר במודל קטן יחסית, אין סיבה אמיתית לשלם על API חיצוני כשעלות השרת העצמי זניחה לחלוטין.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/mdeberta-v3-base")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בקוד סגור ולהפיץ אותו בחופשיות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית של מיקרוסופט בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗