GPT
D

DeBERTa-v3-large-mnli-fever-anli-ling-wanli

קוד פתוח

MoritzLaurermit2022-06-06

  • transformers
  • pytorch
  • onnx
  • safetensors
  • deberta-v2

המודל הזה מציע סיווג טקסטים מדויק בלי צורך באימון מוקדם על הנתונים שלכם. הוא עוקף מודלים גדולים ממנו במבחני הסקה לוגית מורכבים באנגלית.

  • 435Mפרמטרים
  • 512טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 157,053הורדות בחודש

מה זה

בסיס המודל הוא DeBERTa-v3-large של מיקרוסופט עם 435 מיליון פרמטרים, שעבר כוונון ייעודי למשימות הסקה לוגית על גבי כמעט 885 אלף זוגות משפטים. במקום להשתמש בסתם עוד נתונים, המאמן סינן החוצה סטים בעייתיים כמו SNLI והתמקד בחומר איכותי ומאתגר יותר. התוצאה היא כלי חזק מאוד לסיווג טקסט חופשי לפי תוויות שתגדירו ברגע הריצה.

במבחני התוצאה המודל עקף את ALBERT-XXL במבחן ANLI ב־8.3 אחוזים, הישג מרשים למודל בסדר גודל כזה. במבחן MultiNLI הוא מגיע לדיוק של מעל 91 אחוז, מה שאומר שבפועל הוא מבין הקשרים עדינים, שלילות ומבנים תחביריים מפותלים הרבה יותר טוב ממודלים ישנים כמו RoBERTa.

מתאים ל

  • סיווג נושאים באנגלית

    זיהוי קטגוריות תוכן באנגלית בלי לאסוף דוגמאות מראש, הודות לדיוק של מעל 91 אחוז במבחני MNLI.

  • אימות טענות מול עובדות

    בדיקה אם משפט מסוים תומך בטענה או סותר אותה, בזכות אימון ייעודי על מאגר FEVER.

  • סינון תגובות מורכבות

    זיהוי כוונות ומשמעות עקיפה בטקסטים קצרים שהכשילו מודלים קודמים במבחן ANLI.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, ולכן הוא לא מתאים לסיווג מאמרים ארוכים בלי לחתוך אותם קודם. בנוסף, המודל אומן אך ורק באנגלית ולא תומך בעברית כלל. היוצר מציין במפורש שהמודל משחזר הטיות סטטיסטיות שהיו קיימות במאגרי המקור, כך שהוא עלול לטעות בסיווג של טקסטים בעלי מבנה לא שגרתי.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד והטוקנייזר שלו לא מותאם לשפות אחרות. אם תזינו לו עברית תקבלו תוצאות חסרות משמעות לחלוטין.

למה הטוקנייזר זורק שגיאה בזמן הטעינה?

הארכיטקטורה של DeBERTa-v3 דורשת תמיכה שלא הייתה קיימת בספריות ישנות. ודאו שאתם עובדים עם חבילת transformers בגרסה 4.13 ומעלה כדי לפתור את הבעיה.

איך מריצים

טעינת המודל נעשית ישירות דרך ספריית transformers בפייתון באמצעות צינור zero-shot-classification רגיל. הקבצים שוקלים 3.9 גיגה בייט בדיוק float16, כך שכרטיס מסך ביתי עם 8 עד 12 גיגה זיכרון יריץ אותו בקלות. במבחנים על מעבד A100 הוא עיבד בין 425 ל־980 טקסטים בשנייה, תלוי במורכבות הנתונים.

שימו לב שגרסאות ישנות של transformers עושות בעיות עם הטוקנייזר של DeBERTa-v3, ולכן חובה לעבוד עם גרסה 4.13 ומעלה. אם אתם צריכים לסווג רק כמה עשרות מסמכים ביום, פנייה ל־API חיצוני תחסוך תחזוקה של שרת עם כרטיס מסך ייעודי.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanli")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. אתם יכולים להריץ אותו, לשלב אותו במערכות מסחריות, לשנות את המשקלים ולמכור מוצרים שמבוססים עליו בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗