GPT
R

roberta-large-mnli

קוד פתוח

FacebookAImit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

סוס עבודה מוכר לסיווג טקסטים באנגלית ללא אימון מוקדם. הוא קובע אם משפט גורר משפט אחר, ובזכות זה ממיין קטעים לפי תוויות חופשיות שתגדירו בעצמכם.

  • 356Mפרמטרים
  • 514טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 306,355הורדות בחודש

מה זה

מדובר בגרסת ה־Large של RoBERTa עם 356 מיליון פרמטרים ו־24 שכבות, שעברה כוונון ייעודי על מאגר MNLI למשימות הסקת מסקנות בין צמדי משפטים. המטרה המקורית שלו היא לזהות האם הנחה מסוימת סותרת היפותזה, נובעת ממנה, או נשארת ניטרלית. בשימוש מעשי, הוא הפך לתקן הנפוץ של Hugging Face למיון מסמכים בשיטת zero-shot, שבה זורקים עליו טקסט יחד עם רשימת תוויות שרירותית, והוא מחזיר התאמות הסתברותיות בלי צורך לגעת במשקלים.

במבחני GLUE המודל הגיע לדיוק של 90.2 על סט הפיתוח של MNLI, ועל מבחן XNLI באנגלית רשם 91.3 אחוזי דיוק. התוצאות האלה אומרות שבסיווג טקסטים יומיומיים או כתבות חדשות באנגלית הוא מזהה הקשרים סמנטיים ברמה גבוהה. יחד עם זאת, התוצאות בשפות אחרות מבוססות על תרגום לאנגלית, מה שמוריד את הדיוק ככל שמתרחקים ממבנה השפה המקורי.

מתאים ל

  • סיווג פניות באנגלית

    מיון מיילים או כרטיסי תמיכה לקטגוריות בלי לאמן מסווג ייעודי מראש.

  • בדיקת עמידה בתנאים

    השוואת צמדי משפטים לצורך זיהוי האם טענה מסוימת עומדת בקנה אחד עם הצהרה קודמת.

  • תיוג תוכן לפי נושאים

    שיוך אוטומטי של מאמרים וקטעי חדשות לרשימת נושאים חופשית שהגדרתם בקוד.

איפה זה נופל

הוא יודע אנגלית בלבד ומעבד עד 514 טוקנים בכל פעם. מסמכים ארוכים, קבצי PDF מורכבים או חוזים פשוט ייחתכו בדרך או ידרשו פירוק מוקדם. עברית לא קיימת פה, ואין טעם לנסות להאכיל אותו בטקסט מקומי בלי לתרגם קודם לאנגלית.

כרטיס המודל מזהיר במפורש שהאימון התבסס על 160 גיגהבייט של טקסט גולמי מהרשת, שכולל תוכן מוטה וסטריאוטיפים קשים סביב מגדר, מקצועות וקבוצות אוכלוסייה. אם תתנו לו לסווג אנשים לתפקידים או מאפיינים אישיים, הוא ישקף את הדעות הקדומות שנמצאו באינטרנט. בנוסף, הוא לא מאומת עובדתית ולא מתאים ליצירת תוכן או לשיפוט של עובדות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לסיווג טקסטים בעברית?

לא באופן ישיר. המודל אומן על קורפוסים באנגלית בלבד ואינו מכיר את השפה העברית. אם המידע שלכם בעברית, תצטרכו לתרגם אותו לאנגלית לפני ההרצה או לחפש מודל רב־לשוני מתאים.

האם המודל מייצר תשובות כמו צ'אט?

לא, הוא אינו מודל מחולל טקסט אלא מסווג שמחזיר הסתברויות והתאמה בין טענות. הוא יודע להכריע האם קטע טקסט מתאים לקטגוריה מסוימת, אך אינו כותב פסקאות או מייצר דיאלוג.

איך מריצים

כדי להריץ אותו צריך בסך הכול שלוש שורות קוד דרך pipeline של transformers עם zero-shot-classification. משקל הקבצים עומד על 5.3 גיגהבייט, כך שהוא דורש מעבד גרפי צנוע יחסית עם לפחות 8 עד 12 גיגהבייט זיכרון כדי לעבוד בקצב סביר וביעילות בזמן ריצה, או זיכרון RAM נדיב אם מריצים על מעבד רגיל.

אם כל מה שאתם צריכים זה לנתח כמה עשרות פריטים ביום, הרמה של שרת ייעודי מיותרת ועדיף להשתמש בנקודת קצה מנוהלת של שירות ענן. לעומת זאת, אם יש לכם קצבי תעבורה גבוהים של עשרות אלפי מסמכים או מידע שחייב להישאר אצלכם בשרת, להרים אותו עצמאית זה מהלך פשוט וחסכוני מאוד ביחס לשימוש במודלי ענק מודרניים.

from transformers import pipeline

pipe = pipeline("text-classification", model="FacebookAI/roberta-large-mnli")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים סגורים, לשנות את הקוד, לרוץ עליו בענן או לארוז אותו בתוך אפליקציה שמפיצים ללקוחות, בלי חובת שיתוף של הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗