GPT
R

rubert-base-cased-nli-threeway

קוד פתוח

cointegratedרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • onnx
  • safetensors
  • bert

הכלי מזהה קשר לוגי בין שני משפטים ברוסית ומחזיר גרירה, סתירה או ניטרליות. הוא מיועד למי שרוצה לסווג טקסטים קצרים ברוסית בלי לאמן מודל מאפס.

  • 178Mפרמטרים
  • 512טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 7,780הורדות בחודש

מה זה

מדובר בהתאמה של RuBERT למשימת היסק טבעי בשפה הרוסית. במקום לנחש קטגוריות סגורות, הוא בודק האם משפט אחד נובע ממשפט אחר, סותר אותו או לא קשור אליו. המבנה הזה נותן לכם יכולת לבצע סיווג ללא אימון מוקדם, למשל כדי לבדוק סנטימנט מול תוויות חיוביות ושליליות.

הבסיס אומן על סדרת מאגרי נתונים מוכרים כמו MNLI ו־SNLI שתורגמו מאנגלית לרוסית באופן אוטומטי. בבדיקות מדד השטח תחת העקומה עבור זיהוי גרירה, המודל השיג ציון כולל של 0.80, שזה גבוה ממודלים רב־לשוניים גדולים בהרבה כמו xlm-roberta ו־bart, אבל נמוך מגרסת ה־twoway של אותו יוצר שהגיעה ל־0.86 על אותן משימות.

מתאים ל

  • סיווג סנטימנט ברוסית

    מאפשר לבדוק האם ביקורת גוררת שביעות רצון או אי שביעות רצון בלי צורך בדוגמאות מתויגות מראש.

  • בדיקת סתירות בטקסטים

    מתאים לזיהוי טענות סותרות ברוסית מול מאגר עובדות ידוע, הודות לזיהוי המדויק יחסית של סתירות.

  • סינון תשובות קצרות

    בודק אם תשובה שנכתבה על ידי משתמש אכן עונה ישירות ונובעת מהשאלה שהוצגה לו.

איפה זה נופל

הנתונים שעליהם הוא אומן תורגמו מאנגלית בתרגום מכונה, מה שיוצר לעיתים עיוותים תחביריים שפוגעים בהבנת שפה טבעית אותנטית. בנוסף, על מבחנים כמו help ו־iie הוא קיבל ציונים נמוכים במיוחד של 0.56 ו־0.61, ירידה חדה מול דגמים אחרים. חובה לבדוק אותו על דוגמאות אמיתיות שלכם לפני שמסתמכים על הסיווג שלו.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. הוא אומן על רוסית בלבד ולא יבין קלט בעברית או באנגלית.

האם כדאי להעדיף אותו על פני מודלים רב־לשוניים גדולים?

עבור רוסית התשובה חיובית, כי במבחנים שנערכו הוא עקף מודלים כמו bart ו־xlm בביצועים הכוללים של זיהוי גרירה. יחד עם זאת, הוא דורש פחות משאבים להרצה מקומית.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בגרסת פייטורץ', יחד עם sentencepiece. שוקל כשני ג'יגה־בייט ומכיל 178 מיליון פרמטרים, כך שאפשר להריץ אותו בקלות על מעבד רגיל של שרת פשוט, אם כי למהירות תגובה עדיף כרטיס גרפי בסיסי.

אם אתם צריכים רק לדעת אם משפט נובע מהשני בלי הבחנה בין סתירה לניטרליות, עדיף לבחור בגרסת twoway שהציגה ביצועים טובים יותר בבדיקות. הרצה עצמית כאן עדיפה על API חיצוני בגלל הגודל הקומפקטי ומהירות הריצה המקומית.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="cointegrated/rubert-base-cased-nli-threeway")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון שימוש במאגר. במצב כזה אין אישור מפורש להשתמש בו במוצר מסחרי, וחברות עם בדיקות תאימות מחמירות לא יוכלו להכניס אותו לקוד שלהן בלי לקבל אישור ישיר מהמפתח.

הרישיון המלא בעמוד המודל ↗