GPT
D

distilbart-mnli-12-1

קוד פתוח

valhallaרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • bart
  • text-classification

גרסה מזוקקת וקלה של bart-large-mnli לסיווג טקסט ללא אימון מוקדם. היא חוסכת משאבים בזמן ריצה כשרמת הדיוק נשארת קרובה למקור.

  • 1,024טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 34,574הורדות בחודש
  • 56לייקים

מה זה

מדובר במודל שמבצע סיווג טקסטים בשיטת zero shot, שנוצר על בסיס המודל bart-large-mnli של פייסבוק. היוצר השתמש בשיטה של שכפול שכבות לסירוגין ואימון עדין נוסף על אותו המידע, ללא מודל מורה פעיל בזמן הזיקוק.

בגרסה הזו יש 12 שכבות מקודד ושכבת מפענח אחת בלבד. מבחינת ביצועים, המודל מגיע לדיוק של 87.08 במבחן matched ודיוק של 87.5 במבחן mismatched על מאגר MNLI. מודל הבסיס המלא מגיע לכ־90 אחוז, כך שהירידה בדיוק עומדת על פחות משלושה אחוזים בלבד תמורת חיתוך ניכר בעומס החישוב.

מתאים ל

  • סיווג פניות תמיכה

    מיון מהיר של הודעות קצרות לפי קטגוריות בלי צורך לתייג דאטה מראש.

  • סינון תוכן מקומי

    בדיקת כוונות ונושאים בטקסטים באנגלית על חומרה חלשה בלי להוציא כסף על שרתים יקרים.

  • בדיקות היתכנות מהירות

    מודל קל משקל שמאפשר לבדוק רעיונות לסיווג אפס דוגמאות בתוך דקות.

איפה זה נופל

הגרסה הזו היא הכי רזה בסדרה, והיא מקריבה דיוק ביחס לגרסאות 12-6 ו־12-9. חלון ההקשר עומד על 1,024 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים או לספרים שלמים. בנוסף, מודלים מסוג MNLI שמאומנים על אנגלית בלבד לא מתמודדים טוב עם עברית בלי אימון ייעודי, אז חייבים לבדוק את התוצאות על הדאטה שלכם לפני שסומכים עליו.

שאלות
נפוצות

האם הוא יעבוד טוב על טקסטים בעברית?

המודל אומן במקור על MNLI באנגלית בלבד. בלי אימון נוסף או תרגום מוקדם של הטקסט, הביצועים שלו על עברית יהיו נמוכים ולא אמינים.

למה לבחור דווקא בגרסת 12-1 ולא בגרסה אחרת בסדרה?

גרסת 12-1 כוללת רק שכבת מפענח אחת ולכן היא המהירה ביותר מבין האפשרויות. אם המהירות וצריכת המשאבים קריטיות יותר מעוד שניים או שלושה אחוזי דיוק, זו הבחירה המתאימה.

איך מריצים

טוענים את המשקלים דרך ספריית transformers בפייתון באמצעות הארכיטקטורה BartForSequenceClassification. עם משקל קבצים של 1.7 גיגה בייט, אפשר להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך בסיסי וזול בלי לחנוק את הזיכרון.

בסדרה הזו יש גרסאות נוספות כמו 12-3 או 12-6 ששומרות על יותר שכבות מפענח ומציגות דיוק גבוה יותר. אם הנפח והמהירות הם השיקול הראשי אצלכם, הגרסה הזו נותנת מענה עצמאי טוב, אבל אם אתם צריכים סיווג של כמויות עצומות פעם ב... אולי עדיף להשתמש ב־API חיצוני במקום להחזיק שרת דולק.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="valhalla/distilbart-mnli-12-1")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. במצב כזה אין אישור שימוש רשמי, מה שאומר שמבחינה משפטית מסוכן להכניס אותו למוצר מסחרי סגור עד שהמפתח יבהיר תחת איזה רישיון הקבצים שוחררו.

הרישיון המלא בעמוד המודל ↗