GPT
D

DeBERTa-v3-base-mnli-fever-anli

קוד פתוח

MoritzLaurermit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • deberta-v2
  • text-classification

פתרון קומפקטי לסיווג טקסטים בלי לאמן מודל מאפס. הוא מציג דיוק מרשים על מבחני היסק לוגי למרות גודל צנוע של 184 מיליון פרמטרים בלבד.

  • 184Mפרמטרים
  • 512טוקנים בהקשר
  • 714 MBמשקל הקבצים
  • 597,228הורדות בחודש

מה זה

הבסיס כאן הוא DeBERTa-v3 של מיקרוסופט, שעבר אימון ייעודי על 763,913 זוגות של הנחות ומסקנות מתוך המאגרים MultiNLI, Fever-NLI ו־ANLI. המטרה העיקרית שלו היא סיווג מסוג zero-shot, כלומר היכולת לקבל טקסט ורשימת תוויות חופשית, ולהחליט לאיזו קטגוריה הטקסט שייך בלי שום כוונון מוקדם לדומיין הספציפי.

במבחני ביצועים הוא מגיע לדיוק של מעל 90% ב־MultiNLI, וסביב 58% בכלל מבחני ANLI שנחשבים קשים במיוחד. המפתח טוען שהגרסה הזו עוקפת כמעט כל מודל גדול במבחני ANLI, מה שהופך אותו לבחירה חזקה כשמחפשים כוח שיפוט לוגי בלי לסחוב משקל עודף של מודלים ענקיים.

מתאים ל

  • מיון פניות תמיכה

    מאפשר לסווג כרטיסי שירות לקטגוריות מוגדרות מראש באנגלית ללא צורך באיסוף דאטה מתויג.

  • בדיקת עובדות קצרות

    אומן על Fever-NLI ומזהה ביעילות סתירות או התאמות בין משפט מקור לטענה נבדקת.

  • סינון תוכן לנושאים

    ממיין פוסטים וידיעות חדשותיות לפי רשימת נושאים משתנה בזמן אמת ובמשקל קל.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד, כך שטקסטים ארוכים כמו מאמרים או מסמכים משפטיים ייחתכו ויאבדו תוכן. בנוסף, הוא אומן באנגלית בלבד. אם תזרקו עליו עברית, הוא לא יידע מה לעשות איתה.

הביצועים במבחן anli-r3 יורדים ל־49.5%, מה שמראה שברגע שהאתגר הלוגי מסובך ומנוסח בצורה מתחכמת, הוא מתקשה להחזיק מעמד.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על מאגרים באנגלית בלבד ואינו מיועד לעבודה עם טקסטים בעברית. שימוש בעברית יוביל לתוצאות שגויות או לבעיות פענוח של הטוקנייזר.

איזו חומרה צריך כדי להריץ אותו בסביבת ייצור?

המודל שוקל 714 מגה בייט וכולל 184 מיליון פרמטרים בלבד. אפשר להריץ אותו על שרת CPU סטנדרטי בלי כרטיס מסך, אם כי GPU בסיסי יספק מהירות עיבוד גבוהה בהרבה במקרה של עומס פניות.

איך מריצים

בגודל של כ־714 מגה בייט ו־184 מיליון פרמטרים, המודל הזה רץ בקלות על מעבד רגיל, ולא מחייב כרטיס מסך ייעודי כדי לעבוד בזמני תגובה סבירים. הוא דורש את ספריית transformers יחד עם התוסף sentencepiece, ומומלץ להשתמש בגרסת ספרייה 4.13 ומעלה כדי להימנע מבאגים בטוקנייזר.

הריצה מתבצעת בשורות קוד בודדות דרך מנגנון ה־pipeline של Hugging Face עבור zero-shot, או ישירות דרך מודל הסיווג אם צריכים פלטים מפורטים של סתירה או גרירה לוגית. אין שום סיבה לשלם על API חיצוני כשחומרה פשוטה וזולה מחזיקה אותו בלי בעיה.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="MoritzLaurer/DeBERTa-v3-base-mnli-fever-anli")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בתוך מוצר סגור, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית של היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗