GPT
D

deberta-v3-large-zeroshot-v1.1-all-33

קוד פתוח

MoritzLaurermit2023-11-27

  • transformers
  • pytorch
  • onnx
  • safetensors
  • deberta-v2

מודל סיווג טקסטים באנגלית שממיין קטגוריות חדשות בלי אימון מחדש. הוא מתאים למי שרוצה למיין תוכן לפי תגיות מותאמות אישית ובמהירות, בלי לבנות מודל ייעודי מאפס.

  • 435Mפרמטרים
  • 512טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 4,187הורדות בחודש

מה זה

המודל מבצע משימה אחת: הוא מקבל טקסט והשערה, ובודק אם הטקסט מאשר את ההשערה או לא. במקום לבחור מתוך שלוש תוצאות כמו מודלי NLI ישנים, הוא מחזיר הכרעה בינארית של התאמה מול אי התאמה, מה שמאפשר לתרגם אליו כמעט כל בעיית סיווג קיימת.

האימון כלל תערובת של 33 מאגרי נתונים שונים ו־387 מחלקות, מניתוח סנטימנט ועד זיהוי רעלים ברשת. המדדים מראים דיוק מאוזן ממוצע של 85.2 אחוזים על פני המאגרים הללו, כשבמשימות בינאריות קלאסיות של סנטימנט כמו אמזון או ילפ הוא מגיע ליותר מ־96 אחוזים. עם זאת, בגלל שהאימון כלל עד 500 דוגמאות מכל מחלקה, התוצאות האלה אינן זירו שוט מוחלט אלא משקפות היכרות מוקדמת עם המבנה של המשימות.

מתאים ל

  • סינון תוכן פוגעני באנגלית

    מזהה קללות, איומים ורעל ברשת בדיוק של מעל 90 אחוזים, על בסיס נתוני ויקיפדיה וטוויטר.

  • מיון כוונות פניות לקוחות

    ממיין שאלות משתמשים לפי קטגוריות טקסטואליות שתגדירו בעצמכם, בלי צורך בדוגמאות אימון.

  • ניתוח סנטימנט פיננסי

    מסווג דיווחי חדשות לחיוב, שלילה או ניטרליות מנקודת מבט של משקיעים, עם 91.9 אחוזי דיוק.

איפה זה נופל

הוא מוגבל לטקסטים קצרים יחסית עד 512 טוקנים, ולא יודע לייצר שום דבר מלבד סיווג. נקודת התורפה הבולטת היא משימות מרובות מחלקות: במאגר manifesto עם 56 מחלקות הדיוק צונח ל־44.1 אחוזים, וב־empathetic עם 32 מחלקות הוא עומד על 58 אחוזים בלבד. בנוסף, הוא אומן באנגלית בלבד. אם יש לכם טקסט בעברית, תצטרכו לתרגם אותו לאנגלית לפני הריצה, כי המודל לא מבין עברית ישירות.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

לא. המודל אומן אך ורק על נתונים באנגלית. אם תזינו לו טקסט בעברית התוצאות יהיו חסרות משמעות, ולכן היוצר ממליץ לתרגם טקסטים לאנגלית במכונה לפני השליחה למודל.

מה ההבדל בין גרסת all-33 לגרסת heldout?

גרסת all-33 ראתה עד 500 דוגמאות מכל משימה בזמן האימון ולכן היא מדויקת יותר ברוב התחומים המוכרים. גרסת heldout נבחנה בלי לראות את המאגרים האלה מראש, ומייצגת את הביצועים האמיתיים של המודל על משימות שהוא מעולם לא פגש.

האם אני צריך לאמן את המודל על הדאטה שלי?

אין צורך. כל הרעיון הוא סיווג באפס דוגמאות, שבו אתם פשוט מגדירים את שמות המחלקות וההשערה הרצויה בקוד והוא מסווג את הטקסט מיד לפי המשמעות הלשונית שלהן.

איך מריצים

טוענים אותו ישירות דרך הספרייה transformers באמצעות pipeline של zero-shot-classification. המשקל הכולל של הקבצים עומד על 3.9 גיגה בייט בדיוק של float16, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה זיכרון מריץ אותו בלי מאמץ מיוחד מקומית או בשרת ענן זול.

אם אתם משתמשים בגרסה ישנה של transformers מתחת ל־4.13, סביר שתיתקלו בשגיאות בריצת הטוקנייזר. אין סיבה לקחת שירותי API יקרים כשהמודל שוקל פחות מארבעה גיגה, אלא אם נפח השאילתות שלכם דורש תשתית שרתים מנוהלת ומבוזרת לחלוטין.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="MoritzLaurer/deberta-v3-large-zeroshot-v1.1-all-33")
print(pipe("שלום"))

הרישיון

הקוד ומשקלי המודל מפורסמים תחת רישיון MIT, שמאפשר שימוש מסחרי, שינוי והפצה חופשית בקוד סגור. יחד עם זאת, מאגרי הנתונים שעליהם אומן מגיעים תחת רישיונות מגוונים ושונים, ולכן מי שמטמיע את המודל במוצר מסחרי צריך לבדוק את תנאי המאגרים המקוריים שמופיעים בדף הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗