GPT
D

deberta-v3-base

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • deberta-v2

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זה כנראה האנקודר הקלאסי הכי חזק שתוכלו לקחת למשימות סיווג והבנה באנגלית. הוא משאיר מאחור מודלים כמו RoBERTa באותו סדר גודל בלי לדרוש תשתית מפלצתית.

  • 512טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 2,939,540הורדות בחודש
  • 441לייקים

מה זה

מדובר באנקודר שמבוסס על שדרוג של ארכיטקטורת DeBERTa באמצעות אימון מקדים בסגנון ELECTRA ושיתוף הטמעות חכם. הרשת כוללת 86 מיליון פרמטרים בשלד עצמו, ועוד 98 מיליון פרמטרים בשכבת ההטמעה בגלל מילון ענק של 128 אלף טוקנים, כשהכול אומן על 160 גיגה בייט של דאטה.

במבחני ביצועים הוא עוקף את הדורות הקודמים. בבדיקות SQuAD 2.0 הוא מגיע לציון F1 של 88.4 לעומת 83.7 ברוברטה בייס, ובמשימת הסקת המסקנות MNLI הוא חוצה את רף ה־90 אחוז דיוק. בשורה התחתונה, משימות הבנת שפה מקבלות פה רמת דיוק שעד לא מזמן דרשה מודלים גדולים ומסורבלים בהרבה.

מתאים ל

  • סיווג טקסטים וניתוח סנטימנט

    דיוק גבוה משמעותית מרוברטה באותו סדר גודל של משאבים.

  • חילוץ תשובות מטקסט קצר

    תוצאות חזקות מאוד במשימות של מענה על שאלות מתוך פסקאות.

  • זיהוי יחס והסקת מסקנות

    המודל נבדק ונבנה להצטיין בהבנת הקשרים לוגיים בין משפטים.

איפה זה נופל

המודל מיועד אך ורק לאנגלית, כך שלטקסט בעברית הוא פשוט לא רלוונטי. חלון ההקשר נעצר ב־512 טוקנים, מה שפוסל אותו מיידית לעיבוד מסמכים שלמים, חוזים ארוכים או תמלולים בלי לפצל אותם לחתיכות קטנות קודם.

בנוסף, מדובר במודל מסוג fill-mask ולא במודל יוצר. אי אפשר לייצר איתו טקסט חופשי, תשובות ארוכות או שיחה, והמטרה העיקרית שלו מוגבלת לחילוץ מידע, סיווג והבנה אחרי אימון ייעודי.

אותה משפחה

deberta יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית?

לא. המודל אומן על אנגלית בלבד ומכיל מילון שמותאם לשפה הזו. טקסט בעברית ייחתך בצורה גרועה ולא יניב תוצאות שמישות.

איך מודל קטן כזה שומר על ביצועים גבוהים?

השימוש בארכיטקטורת DeBERTa V3 משלב תשומת לב מופרדת עם שיטת אימון בסגנון ELECTRA. זה מאפשר ללמוד ייצוגים יעילים יותר מכל דוגמה בלי לנפח את כמות הפרמטרים בליבה.

איך מריצים

המודל שוקל 1.7 גיגה בייט בפורמט של transformers, כך שאפשר להריץ אינפרנס בקלות על כרטיס מסך בסיסי או אפילו על מעבד רגיל. אם אתם מתכננים לעשות עליו fine tuning מלא, מיקרוסופט מדגימים אימון מקבילי על שמונה מעבדים גרפיים, אבל למשימות קטנות אפשר להסתדר עם כרטיס בודד אם מקטינים את גודל ה־batch.

אין סיבה לשלם על API חיצוני למשימות סיווג נקודתיות כשהמשקל כל כך נמוך והאינטגרציה בספרייה הקיימת שלכם דורשת שורות קוד בודדות. הרצה עצמית נותנת לכם שליטה מלאה בנתונים ובזמני התגובה בלי עלויות שימוש פר קריאה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/deberta-v3-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT מלא. אפשר לקחת את הקוד והמשקלים לכל שימוש, כולל מוצרים מסחריים סגורים, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. הדרישה היחידה היא להשאיר את הצהרת זכויות היוצרים המקורית של מיקרוסופט בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗