GPT
D

deberta-v3-base-tasksource-nli

קוד פתוח

sileodapache-2.02023-01-13

  • transformers
  • pytorch
  • safetensors
  • deberta-v2
  • text-classification

מודל קטן לסיווג טקסטים באנגלית ללא אימון מקדים, שמציג דיוק גבוה בזכות אימון על מאות משימות במקביל. הוא מתאים למי שרוצה קלסיפיקציה מהירה ויציבה בלי להחזיק מודל ענק.

  • 184Mפרמטרים
  • 512טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 26,592הורדות בחודש

מה זה

מדובר בהתאמה של DeBERTa-v3-base שעברה אימון מרובה משימות על יותר מ־600 משימות שונות מתוך אוסף tasksource. במקום להסתפק באימון NLI שגרתי, היוצר שילב דאטה-סט ייעודי בשם label-nli שמשפר ספציפית את היכולת להדביק תוויות שרירותיות לקטעי טקסט. לפי הערכת מיחזור המודלים של IBM, הוא הגיע למקום הראשון מבין כל המודלים שמבוססים על הארכיטקטורה הזו, עם תוצאה של 70% ב־WNLI.

המודל כולל ראש סיווג של MNLI ומאפשר גישה למאות מתאמים עבור משימות קיימות בעזרת ספריית tasknet. היתרון במתאמים האלה הוא חיסכון בזמן חישוב, כי הם דורשים רק מעבר קדימה אחד לכל דוגמה, בניגוד לחישוב נפרד לכל תווית אפשרית בסיווג פתוח. בנוסף, אפשר לקחת את המשקולות שלו כנקודת פתיחה יעילה לכוונון עדין על משימות סיווג חדשות.

מתאים ל

  • סיווג טקסטים ללא דאטה

    מאפשר להגדיר קטגוריות חופשיות באנגלית ולמיין פניות או פריטים בלי לאסוף דוגמאות מתויגות.

  • הסקת שפה טבעית

    בודק אם משפט אחד נובע ממשפט אחר, מתאים לבדיקת עקביות בין שני קטעי טקסט קצרים.

  • בסיס לכוונון עדין

    משמש נקודת מוצא מאומנת היטב לאימון מסווג ייעודי על דאטה-סט קטן באמצעות tasknet.

איפה זה נופל

הבעיה המרכזית כתובה בראש הכרטיס, היוצר עצמו מגדיר את המודל כמיושן וממליץ לעבור ל־deberta-small-long-nli שמציע חלון הקשר ארוך יותר ודיוק עדיף. מגבלת האורך כאן היא 512 טוקנים בלבד, כך שטקסטים ארוכים נחתכים. בנוסף, המודל אומן על אנגלית בלבד ולא יתאים לטקסט בעברית, וסיווג עם רשימת תוויות גדולה מייצר איטיות מורגשת כי המודל בודק כל אפשרות בנפרד.

שאלות
נפוצות

האם המודל עובד על טקסטים בעברית?

לא. המודל אומן אך ורק על השפה האנגלית ומיועד לעבודה באנגלית. הרצה על טקסט בעברית תניב תוצאות שגויות או לא יציבות.

למה שהיוצר ימליץ לא להשתמש בו?

המודל הוגדר כ־deprecated מפני שיצאה גרסה חדשה ומוצלחת יותר של אותו יוצר, deberta-small-long-nli. הגרסה ההיא מציעה דיוק משופר ותמיכה בטקסטים ארוכים יותר מחלון 512 הטוקנים שיש כאן.

איך מריצים

עם 184 מיליון פרמטרים ומשקל קבצים של 1.4 גיגה-בייט, המודל רץ בקלות על מעבד רגיל או על כרטיס מסך בסיסי וזול. בסביבת פייתון מריצים אותו ישירות דרך ספריית transformers עם pipeline מוכן מראש לסיווג אפס דוגמאות או להסקת שפה טבעית.

אין סיבה לשלם לספק ענן על שירות מנוהל כשמדובר בגודל כזה. שרת פשוט או מכונה מקומית מריצים אותו בלי צווארי בקבוק משמעותיים, אלא אם כן אתם צריכים לטפל באלפי תוויות במקביל לכל שאילתה, מצב שבו בדיקת כל תווית בנפרד תעמיס על המעבד.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="sileod/deberta-v3-base-tasksource-nli")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות והפצה בתוך מוצר סגור. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובת פתיחה של הקוד שפיתחתם מסביב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗