GPT
D

deberta-v3-large-tasksource-nli

קוד פתוח

sileodapache-2.02023-03-27

  • transformers
  • pytorch
  • safetensors
  • deberta-v2
  • text-classification

גרסה מכווננת של דברטה לארג' שעברה אימון על 600 משימות שונות במקביל. היא מיועדת למי שצריך סיווג טקסטים חכם באנגלית בלי לאמן מודל מאפס על הנתונים שלו.

  • 435Mפרמטרים
  • 512טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 3,528הורדות בחודש

מה זה

הבסיס כאן הוא ארכיטקטורת DeBERTa-v3 עם 24 שכבות וקצת יותר מ־435 מיליון פרמטרים. במקום להסתפק באימון רגיל על סט נתונים בודד, המפתח אימן את המודל במקביל על מאות משימות מתוך אוסף tasksource, כולל שאלות ברירה מרובה, משימות NLI, ומאגרי מידע כמו bigbench ונתוני rlhf של Anthropic. בפועל קיבלתם מקודד יחיד שחולק משקולות ומעליו ראש סיווג של MNLI.

האימון הרחב הזה הופך אותו לחזק מאוד בסיווג של טקסטים שלא פגש מעולם. במבחן WNLI הוא הגיע ל־77% דיוק בלי אימון מקדים על המשימה, ובבדיקת linear probing על וקטור ה־CLS הוא מוציא 90% ב־MNLI. זה אומר שהייצוג הפנימי שהוא בונה למשפטים עשיר מספיק כדי להבין יחסים מורכבים בין הנחות למסקנות, מה שהופך אותו לבסיס טוב גם להמשך כיוונון מותאם אישית.

מתאים ל

  • סיווג טקסט ללא אימון

    זיהוי כוונות או נושאים באנגלית על בסיס הגדרת תוויות בלבד, בזכות ביצועים גבוהים במשימות NLI.

  • הבנת שאלות רב-ברירה

    הכרעה בין אפשרויות שונות מתוך טקסט נתון, יכולת שנבנתה מאימון על מאגרים רחבים כולל bigbench.

  • בסיס לכיוונון מותאם

    נקודת התחלה לסיווג מותאם אישית שחוסכת שעות אימון ומשיגה דיוק גבוה עם מעט מאוד נתוני אימון.

איפה זה נופל

המודל מוגבל לחלון הקשר קצר של 512 טוקנים בלבד. אי אפשר לזרוק אליו מסמכים ארוכים, תמלילי שיחות או מאמרים שלמים בלי לחתוך אותם קודם. הוא גם אומן על אנגלית בלבד, כך שטקסט בעברית כנראה יחזיר תוצאות חלשות ולא עקביות. האימון הוגבל לתקרת 64 אלף דוגמאות למשימה, כך שמשימות מורכבות במיוחד שדורשות עומק של דאטה ייעודי עדיין יחייבו אתכם לעשות fine-tuning משלכם.

שאלות
נפוצות

האם המודל מבין טקסטים בעברית?

הוא אומן על נתונים באנגלית בלבד. הארכיטקטורה לא נבנתה לטפל בעברית, והטוקנייזר שלו יתקשה מאוד לחלק מילים עבריות ביעילות, מה שיוביל לתוצאות גרועות ולניצול מהיר של מגבלת הטוקנים.

האם אפשר להשתמש בו למיון פסקאות ארוכות?

לא באופן ישיר. חלון ההקשר נעצר ב־512 טוקנים, שזה בערך עמוד טקסט קצר באנגלית. אם יש לכם טקסט ארוך יותר, תצטרכו לפצל אותו למקטעים קטנים, להריץ סיווג על כל מקטע בנפרד, ולחבר את התוצאות בקוד שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על כ־3.3 גיגה-בייט בדיוק של float32, כך שלא תצליחו לדחוף אותו לכל שרת זול בלי לחשוב קודם. כדי להריץ אותו עם transformers בזמני תגובה סבירים לייצור, תצטרכו כרטיס מסך מודרני עם לפחות 8 עד 12 גיגה זיכרון גרפי, במיוחד אם אתם מעבדים באצ'ים ולא משפט בודד בכל פעם.

אם אין לכם כרטיס מסך ייעודי פנוי ואתם שולחים רק כמה עשרות או מאות בקשות ביום, עדיף להשתמש בנקודת קצה מנוהלת או שירות ענן חיצוני. תשלמו רק על מה שצרכתם ותחסכו תחזוקת תשתית עבור מודל שסתם יישב ויחכה לפניות.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="sileod/deberta-v3-large-tasksource-nli")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שזה בדיוק מה שאתם רוצים לראות בפרויקט מסחרי. מותר לקחת את המשקולות, להריץ אותן במוצר שלכם, לשנות את הקוד ואפילו לחלק אותו הלאה, בלי לשלם תמלוגים. התנאי היחיד הוא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗