GPT
D

deberta-v3-small

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • deberta-v2
  • deberta

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסה קלה ומהירה של ארכיטקטורת NLU מתקדמת, שמתאימה למי שצריך ביצועים של מודלים גדולים אבל מוגבל בחומרה. היא נותנת מענה מצוין להבנת שפה באנגלית כשזמן התגובה קריטי.

  • 512טוקנים בהקשר
  • 814 MBמשקל הקבצים
  • 633,347הורדות בחודש
  • 78לייקים

מה זה

מיקרוסופט אימנה כאן מודל מסוג מסיכה שמיועד למשימות הבנת שפה טבעית, תוך שימוש באימון בסגנון ELECTRA ובחלוקת וקטורים ייחודית. השלד שלו כולל 6 שכבות ו־44 מיליון פרמטרים בלבד, אבל שכבת הווקטורים גדולה מאוד ומכילה 128 אלף טוקנים שמוסיפים עוד 98 מיליון פרמטרים. האימון עצמו נעשה על 160 גיגה בייט של דאטה.

התוצאה בפועל מעניינת במיוחד מול מודלים סטנדרטיים. במבחני MNLI הוא מגיע לדיוק של 88.3, וב־SQuAD 2.0 לציון F1 של 82.8. המספרים האלה מראים שבמשימות סיווג והסקה הוא כמעט משתווה ל־RoBERTa-base ול־ELECTRA-base, למרות שיש לו רק חצי מכמות הפרמטרים בשלד החישוב.

מתאים ל

  • סיווג טקסטים מהיר

    הוא מציג דיוק שמתחרה במודלים כבדים בהרבה ומחזיר תשובות בזמן קצר מאוד.

  • הסקה לוגית באנגלית

    התוצאות שלו במבחני MNLI מוכיחות יכולת טובה מאוד בזיהוי קשרים בין משפטים.

  • חילוץ מידע מקטעים קצרים

    ציוני SQuAD מעידים על יכולת טובה באיתור תשובות בתוך טקסט ממוקד.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, כך שהוא לא מתאים למסמכים ארוכים בלי חיתוך מוקדם. בנוסף, המודל אומן על אנגלית בלבד. אם תנסו להריץ עליו טקסטים בעברית, הוא פשוט ייכשל כי המילון שלו לא מכסה את השפה. צריך גם לזכור שזהו מודל בסיס למילוי מסיכות, ולכן חייבים לעשות לו פיין טיונינג ייעודי לפני שאפשר להשתמש בו למיון או למענה על שאלות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות לצ'אט או ליצירת טקסט?

לא. זהו מודל מסוג fill-mask ולא מודל גנרטיבי שפולט תשובות חופשיות. הוא נועד לקרוא טקסט, להבין אותו ולחזות מילים חסרות או לתת ציונים לסיווג לאחר אימון נוסף.

האם הוא יעבוד טוב על נתונים בעברית?

הוא אומן על אנגלית בלבד. המילון שלו לא מכיל תמיכה ייעודית בעברית, ולכן הוא לא מתאים למשימות בשפה המקומית בלי אימון מקדים נרחב מאפס.

איך מריצים

המודל שוקל כ־814 מגה בייט בלבד בקבצי המשקולות שלו, ולכן הוא רץ בקלות על כרטיס מסך פשוט או על מעבד סטנדרטי בלי שום מאמץ. בספריית transformers מריצים אותו ישירות, והאימון הנוסף למשימות סיווג נעשה בקלות דרך סקריפטים מוכנים.

במשקל כזה אין שום סיבה לשלם ל־API חיצוני או להסתמך על שירותי ענן יקרים. אתם מורידים אותו, טוענים בזיכרון מקומי ומקבלים זמני תגובה נמוכים מאוד בעלות חומרה אפסית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/deberta-v3-small")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 814 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו למוצרים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו בקוד סגור, בלי תמלוגים או דרישות מורכבות, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗