GPT
D

deberta-v3-large

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • deberta-v2
  • deberta

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זה כנראה מודל הבסיס הטוב ביותר להבנת שפה באנגלית לפני עידן ה־LLM הענקיים. הוא עוקף את רוברטה כמעט בכל מדד הבנה בלי לדרוש תשתית מפלצתית.

  • 512טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 1,370,834הורדות בחודש
  • 287לייקים

מה זה

מיקרוסופט לקחו את הארכיטקטורה של דברטה ואימנו אותה מחדש בשיטה שמזכירה את אלקטרה, עם שיתוף אמבדינגס ואימון על 160 גיגה בייט של טקסט. התוצאה היא 304 מיליון פרמטרים בגוף המודל ועוד 131 מיליון בשכבת האמבדינגס, בין היתר בגלל מילון מורחב של 128 אלף טוקנים.

בבדיקות השוואה הוא מוביל בבירור על פני רוברטה לארג ודברטה המקורי. ב־SQuAD 2.0 למשל הוא מגיע לציון F1 של 91.5 לעומת 89.4 של רוברטה, וב־MNLI הוא מגרד כמעט 92 אחוזי דיוק. המשמעות בפועל פשוטה: הוא מזהה קשרים בין משפטים ומחלץ תשובות מטקסט בצורה חדה ומדויקת יותר מרוב המתחרים בגודל שלו.

מתאים ל

  • סיווג טקסטים באנגלית

    דיוק גבוה במיוחד בסיווג כוונות, ניתוח רגש וקטלוג מסמכים קצרים, מעל לביצועים של רוברטה.

  • מערכות שאלות ותשובות

    חילוץ מדויק של תשובות מתוך פסקאות נתונות, עם תוצאות מוכחות במבחני SQuAD 2.0.

  • זיהוי יחסים והיקש לוגי

    השוואת זוגות משפטים לבדיקת סתירה, אימות או חפיפה תוכנית בביצועי שיא לקטגוריה.

איפה זה נופל

הוא מוגבל לחלון הקשר קצרצר של 512 טוקנים בלבד, מה שפוסל אותו מניתוח מסמכים שלמים או חוזים ארוכים בלי חיתוכים מורכבים. בנוסף, המודל אומן אך ורק על אנגלית. אין לו תמיכה מובנית בעברית, ואם תזרקו עליו טקסט מקומי תקבלו תוצאות שבורות. לבסוף, המשימה הבסיסית שלו היא השלמת מילים והבנה, הוא לא מודל שיודע לייצר טקסט חופשי או לנהל שיחה כמו מודלים גנרטיביים.

שאלות
נפוצות

האם הוא מתאים לעבודה עם טקסטים בעברית?

לא. המודל אומן על טקסטים באנגלית בלבד והמילון שלו לא כולל אוצר מילים ייעודי לעברית. הרצה של עברית עליו תייצר תוצאות גרועות בגלל פירוק יתר של מילים לטוקנים בודדים וחוסר ידע לשוני.

אפשר להשתמש בו כמו צ'אטבוט או ליצירת תוכן?

ממש לא. מדובר במודל מסוג אנקודר בלבד שמיועד למשימות כמו השלמת מילים חסרות, סיווג וחילוץ מידע. הוא לא נבנה כדי להמשיך טקסט או לכתוב פסקאות חדשות.

כמה זיכרון GPU צריך כדי לאמן אותו?

להסקה מספיק כרטיס עם שמונה גיגה בייט זיכרון. לאימון מחדש או פיין-טיונינג תצטרכו כרטיס של 16 או 24 גיגה בייט לפחות, ואם תרצו באצ'ים גדולים תצטרכו לעבוד במערך של כמה כרטיסים כפי שמיקרוסופט מדגימים.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.0 גיגה בייט, כך שכל כרטיס מסך מודרני עם שמונה גיגה בייט של VRAM יריץ אותו להסקה בקלות דרך ספריית transformers. אם אתם מתכננים לעשות עליו פיין-טיונינג מלא, התמונה משתנה לגמרי. הסקריפט הרשמי מדגים אימון על שמונה כרטיסי מסך במקביל.

אם יש לכם רק שרת מקומי קטן ואתם רוצים לאמן אותו מאפס למשימה שלכם, תצטרכו להשקיע ב־GPU ענן חזק או להסתפק במודל קטן יותר. להסקה בלבד אין שום סיבה לשלם ל־API חיצוני, הוא קל מספיק כדי לשבת אצלכם בקונטיינר.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/deberta-v3-large")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר לעשות איתו כמעט הכל, כולל הטמעה במוצרים מסחריים סגורים ושינוי הקוד והמשקלים, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗