GPT
D

deberta-v3-large-zeroshot-v2.0

קוד פתוח

MoritzLaurermit2024-04-01

  • transformers
  • onnx
  • safetensors
  • deberta-v2
  • text-classification

המודל מסווג טקסטים באנגלית לכל קטגוריה שתגדירו בלי צורך באימון מוקדם. הוא נותן דיוק גבוה משמעותית ממודלים ותיקים כמו BART, אבל דורש תשומת לב משפטית לפני שימוש מסחרי.

  • 435Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 150,657הורדות בחודש

מה זה

המודל מתמחה בסיווג טקסט ללא דוגמאות מוקדמות, zero shot, באמצעות המרת משימת הסיווג להסקה לוגית של משפט מול השערה. אתם מגדירים תבנית והיפותזה, והוא מחזיר הסתברות לכל קטגוריה, בין אם מדובר בבחירה יחידה או בסיווג מרובה תוויות.

במבחני ביצועים על 28 מאגרי נתונים, המודל השיג ציון מאקרו F1 ממוצע של 0.673 במצב אפס דוגמאות, וקפץ ל־0.846 כשהוסיפו לו עד 500 דוגמאות לכל מחלקה. לשם השוואה, facebook/bart-large-mnli ששימש תקן דה פקטו בתחום עומד על ממוצע של 0.497 בלבד. ביתרון הזה מורגש במיוחד במשימות עמוסות קטגוריות כמו banking77, שבהן הוא מגיע ל־0.567 לעומת 0.312 של בארט.

ההבדל העיקרי מול סדרת ה־c המקבילה שלו טמון בנתוני האימון. הגרסה הזו כוללת מאגרים רחבים יותר כמו ANLI ו־WANLI, שמקפיצים את הביצועים אבל מגיעים עם תערובת רישיונות שלא כולם פתוחים לשימוש מסחרי מובהק.

מתאים ל

  • סיווג פניות תמיכה בנקאיות

    משיג ציון של מעל 0.56 ב־banking77 בלי שום דוגמה מוקדמת, מעל כל מודל מקביל בגודל שלו.

  • סינון תוכן פוגעני ברשת

    עובר את ה־0.87 בזיהוי איומים וניבולי פה במאגרי wikitoxic בלי צורך לאמן מסווג ייעודי.

  • ניתוח סנטימנט ביקורות מוצר

    מגיע ליותר מ־0.95 בדיוק על ביקורות אמזון ו־yelp ישירות מהקופסה, מתאים לקטלוג מהיר של פידבק.

איפה זה נופל

הוא מוגבל לטקסטים באנגלית בלבד. אם יש לכם טקסט בעברית תצטרכו לתרגם אותו קודם במכונה, או לעבור למודל רב לשוני כמו bge-m3. חלון ההקשר מוגבל ל־512 טוקנים, בערך 400 מילים, ומסמכים ארוכים מזה יחתכו או יפגעו בדיוק. מעבר לזה, במשימות פוליטיות מורכבות כמו manifesto הוא השיג רק 0.256, כך שהוא מתקשה מאוד כשהקטגוריות דורשות הבנה אידיאולוגית עמוקה.

שאלות
נפוצות

האם המודל יודע לקרוא ולסווג עברית?

לא. המודל אומן על אנגלית בלבד. אם תזינו לו טקסט בעברית התוצאות יהיו חסרות ערך, ולכן צריך לתרגם את הטקסט לאנגלית לפני הסיווג או להשתמש במודל כמו bge-m3-zeroshot-v2.0 שתומך בריבוי שפות.

למה לא לקחת פשוט את גרסת ה־c?

גרסת ה־c בטוחה לחלוטין מבחינה משפטית מסחרית כי היא אומנה רק על דאטה ייעודי, אבל המודל הנוכחי מציג ביצועים מעט טובים יותר בחלק מהמשימות בזכות נתונים מגוונים יותר. אם החברה שלכם רגישה לזכויות יוצרים של דאטהסטים, קחו את גרסת ה־c.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון עם ה־pipeline הייעודי ל־zero-shot-classification. הקבצים שוקלים 2.5 גיגה בייט ב־float16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יריץ אותו בקלות, ואפשר לדחוף אותו גם ל־CPU אם זמן התגובה פחות קריטי.

המודל איטי יותר ממשפחת RoBERTa, והוא לא נתמך ישירות בקונטיינרים מבוססי TEI עם Flash Attention שמיועדים לפרודקשן תובעני. אם אתם צריכים לייטנסי נמוך במיוחד באלפי בקשות בשנייה, עדיף להריץ RoBERTa או לקרוא ל־API מנוהל כמו Hugging Face Endpoints במקום להחזיק תשתית GPU משלכם.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="MoritzLaurer/deberta-v3-large-zeroshot-v2.0")
print(pipe("שלום"))

הרישיון

הקוד ומשקלי הבסיס פורסמו תחת רישיון MIT, שמאפשר שימוש מסחרי מלא והפצה חופשית. עם זאת, המודל הספציפי הזה אומן על מאגרי נתונים חיצוניים עם רישיונות מעורבים וחלקם לא מסחריים. היוצר מבהיר שאם יש לכם דרישות משפטיות מחמירות בארגון, מומלץ לקחת את גרסת ה־c שכוללת אך ורק נתוני אימון מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗