GPT
D

deberta-v3-xsmall

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • deberta-v2
  • deberta

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שפה קומפקטי שמביא ביצועים של מודלים גדולים בהרבה במשימות הבנת טקסט. הוא מיועד למי שרוצה אימון מהיר והסקה זולה בלי לשלם בדיוק.

  • 512טוקנים בהקשר
  • 640 MBמשקל הקבצים
  • 48,010הורדות בחודש
  • 48לייקים

מה זה

מדובר בארכיטקטורת DeBERTa מהדור השלישי, שמשתמשת באימון מקדים בסגנון ELECTRA כדי לחלץ דיוק גבוה ממעט פרמטרים. יש לו 22 מיליון פרמטרים בעמוד השדרה וגודל מילון של 128 אלף טוקנים שמוסיף עוד 48 מיליון באמברדינגס, על גבי 12 שכבות וגודל חבוי של 384.

במדדי השוואה מול מודלים ותיקים, הוא עוקף את RoBERTa-base בבדיקות SQuAD 2.0 עם F1 של 84.8 לעומת 83.7, ומשתווה לו ב־MNLI עם 88.1 אחוזי דיוק, למרות שהוא מחזיק רבע מכמות הפרמטרים בשלד שלו. המשמעות היא שמקבלים הבנת הנקרא וסיווג ברמה מסחרית בחלקיק ממשאבי החישוב.

מתאים ל

  • סיווג כוונות וטקסטים

    אימון מהיר על נתוני תמיכה באנגלית לזיהוי נושאים בעלות חישוב אפסית.

  • מענה על שאלות מפסקאות

    דיוק של 84.8 ב־SQuAD 2.0 הופך אותו לבסיס מעולה לשליפת תשובות מטקסט.

  • הסקה על שרתי קצה

    משקל של 640 מגה מאפשר להריץ אותו ישירות על מחשבים פשוטים ללא GPU.

איפה זה נופל

הוא אומן אך ורק על טקסט באנגלית מתוך מאגר של 160 גיגה בייט, כך שהוא לא יזהה עברית ולא מיועד לטקסט רב־לשוני. מעבר לזה, חלון ההקשר שלו מוגבל ל־512 טוקנים, מה שפוסל אותו מניתוח מסמכים שלמים או חוזים ארוכים בלי חלוקה מוקדמת לפסקאות.

שאלות
נפוצות

האם המודל מתאים לייצור תוכן?

לא. מדובר במודל שמאומן למשימת fill-mask והבנת שפה, ולא במודל אוטורגרסיבי שכותב תשובות ארוכות כמו צ'אטבוט.

למה שכבת האמברדינג שלו כל כך גדולה ביחס למודל?

הוא משתמש במילון רחב של 128 אלף טוקנים שתופס 48 מיליון פרמטרים, מה שמייעל את ייצוג המילים אבל משאיר את החישוב בשכבות עצמן רזה מאוד עם 22 מיליון פרמטרים בלבד.

איך מריצים

המודל שוקל 640 מגה בייט ורץ בקלות בספריית transformers של פייתון. הוא לא דורש כרטיס גרפי כבד, ואפשר להריץ עליו הסקה אפילו על מעבד רגיל או על השרת הכי זול בענן בלי להרגיש זמני תגובה ארוכים.

אם יש לכם צורך בסיווג פשוט או חילוץ מידע, אין שום סיבה לשלם לספקי צד שלישי לפי קריאת API. מורידים את המשקלים, מאמנים שכבת סיווג בכמה דקות, ומריצים שירות עצמאי וזול.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/deberta-v3-xsmall")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לגמרי. אפשר לקחת את הקוד והמשקלים, לשנות אותם, לאמן הלאה ולשלב אותם במוצר מסחרי סגור, בלי דרישה לפתוח את הקוד שלכם ובתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗