GPT
D

deberta-base

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • deberta

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שפה שמיועד למשימות הבנה והשלמת טקסט, ומשפר את הארכיטקטורה של ברט. הוא מתאים למי שרוצה ביצועי דיוק גבוהים יותר בלי להגדיל את נפח הזיכרון.

  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 322,453הורדות בחודש
  • 86לייקים

מה זה

מייקרוסופט בנו כאן שדרוג ישיר למודלים כמו RoBERTa, כשהרעיון המרכזי הוא מנגנון קשב שמפריד בין התוכן של המילה לבין המיקום היחסי שלה במשפט. במקום לערבב וקטור של תוכן עם מיקום מראש, המודל מחשב את הקשרים ביניהם בנפרד, ומוסיף מפענח משופר לחיזוי מילים מוסתרות.

המטרה העיקרית כאן היא משימות סיווג, הסקת מסקנות וניתוח טקסט באנגלית. במבחנים כמו SQuAD ו־MNLI המודל עוקף את RoBERTa-base ואפילו את XLNet-Large, מה שאומר שבפועל תקבלו תשובות מדויקות יותר לשאלות מתוך טקסט וזיהוי טוב יותר של קשרים לוגיים, מבלי לשלם במחיר החישובי של מודל ענק.

מתאים ל

  • מענה על שאלות מטקסט

    משיג תוצאות גבוהות במבחני SQuAD, ולכן מעולה לחילוץ תשובות מתוך פסקאות נתונות.

  • זיהוי יחסים לוגיים

    התוצאות במבחן MNLI מראות שהוא מדויק מאוד בסיווג של סתירה, גרירה או ניטרליות בין משפטים.

  • השלמת מילים מוסתרות

    המשימה הבסיסית של המודל, טובה לבדיקות לשוניות ובחינת סבירות של מילים במשפט.

איפה זה נופל

המודל אומן רק על אנגלית, כך שהוא לא מתאים לעברית או לשפות אחרות. מגבלה נוספת היא חלון הקשר של 512 טוקנים, שלא יאפשר לכם לנתח מסמכים שלמים ברצף אלא יחייב חיתוך לפסקאות. חוץ מזה, מדובר במודל שמנחש מילים מוסתרות ולא במודל שיוצר טקסט חופשי, כך שלא תוכלו להשתמש בו לשיחה או לכתיבת תוכן.

אותה משפחה

deberta יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או ליצירת טקסט?

לא. המודל עובד כמפענח להבנת טקסט והשלמת מילים חסרות, ולא מייצר פסקאות חדשות כמו מודלים אוטורגרסיביים.

האם הוא יעבוד טוב עם טקסטים בעברית?

הוא אומן על אנגלית בלבד. אם תזינו לו עברית תקבלו תוצאות חלקיות או שגיאות, ועדיף לחפש מודל שאומן ספציפית לשפה.

איך מריצים

הקבצים שוקלים 1.6 גיגה-בייט בסך הכול ומכילים 12 שכבות, כך שקל מאוד להריץ אותו מקומית. כרטיס מסך בסיסי עם 4 או 8 גיגה זיכרון יספיק לגמרי להסקה וגם לאימון עדין של שכבות הסיווג, ואפשר אפילו להריץ אותו על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

אין סיבה אמיתית לשלם על שירותי ענן חיצוניים או API מרוחק בשביל משקל כזה, אלא אם כן אתם צריכים לטפל באלפי בקשות בשנייה ורוצים לחסוך תחזוקת שרתים. בעזרת ספריית transformers מעלים אותו בכמה שורות קוד פשוטות ישירות לפרויקט.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/deberta-base")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון MIT. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן עליו ולהטמיע אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗