GPT
X

xlm-roberta-large-xnli

קוד פתוח

joeddavmit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • xlm-roberta

סיווג טקסטים בכמה שפות בלי לאמן מודל מאפס ובלי דוגמאות מתויגות. מזינים טקסט ותוויות בכל שפה נתמכת, והוא מזהה את הקטגוריה המתאימה.

  • 561Mפרמטרים
  • 514טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 121,305הורדות בחודש

מה זה

הבסיס כאן הוא מודל שפה שאומן על כמאה שפות, ועבר אימון ייעודי למשימת הסקת מסקנות טקסטואלית בחמש עשרה שפות שונות. המבנה הזה הופך אותו לכלי יעיל למיון טקסטים בלי להגדיר דוגמאות מראש, גם אם מדובר בטקסט ברוסית, ספרדית, ערבית או צרפתית.

הייחוד שלו הוא היכולת לחבר בין שפות שונות באותה בדיקה. אפשר להזין משפט בשפה אחת ולבקש לתייג אותו באמצעות תוויות בשפה אחרת לגמרי. אימון המודל כלל ערבוב מכוון של שפות בין הטקסט לטענה, ולכן הוא יודע לגשר על פערים כאלה בלי לתרגם קודם.

מתאים ל

  • סיווג פניות תמיכה רב לשוני

    ניתוב כרטיסים בשפות שונות למחלקות המתאימות בלי צורך בתרגום מוקדם של הטקסט.

  • ניטור נושאים ברשתות זרות

    זיהוי שיחות ותחומי עניין במגוון שפות באמצעות הגדרת תוויות כלליות באנגלית.

  • מיון מסמכים קצרים

    חלוקת פסקאות והודעות לקטגוריות מוגדרות מראש ללא אימון נתונים ייעודי למערכת.

איפה זה נופל

הקלט מוגבל ל־514 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים או מאמרים שלמים בלי פירוק מוקדם. בנוסף, אף שהבסיס שלו מכיר מאה שפות, האימון לסיווג בוצע ישירות על 15 שפות בלבד, ביניהן אנגלית, ערבית, רוסית וצרפתית. עברית לא נכללת ברשימת הליבה המאומנת, ולכן הביצועים בה עלולים להיות פחות יציבים ודורשים בדיקה זהירה לפני שימוש אמיתי.

שאלות
נפוצות

איך המודל מתמודד עם טקסטים בעברית?

הבסיס אומן על מאה שפות שכוללות עברית, אך אימון הסיווג הספציפי נעשה על 15 שפות אחרות. הוא עשוי לעבוד במידה מסוימת, אבל צריך לבדוק את הדיוק בעצמכם מול נתונים אמיתיים.

האם כדאי להשתמש בו אם כל הטקסטים שלי באנגלית?

לא. היוצר מציין במפורש שעבור אנגלית בלבד עדיף להשתמש במודלים ייעודיים כמו bart-large-mnli, שמספקים דיוק גבוה יותר.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון באמצעות שורות בודדות עם pipeline ייעודי. הקבצים שוקלים 6.3 גיגה בייט ומכילים 561 מיליון פרמטרים על פני 24 שכבות, כך שנדרש כרטיס מסך עם לפחות שמונה עד עשרה גיגה בייט זיכרון כדי להריץ הסקה יציבה בקצב סביר.

אם אתם צריכים לסווג טקסטים באנגלית בלבד, המפתח עצמו ממליץ לוותר עליו ולבחור במודל מבוסס BART שנותן תוצאות עדיפות בשפה זו. היתרון בהרצה מקומית הוא שליטה מלאה בפרטיות ובקצב, אך במקרים של עומס נמוך מאוד או היעדר חומרה ייעודית, עדיף להשתמש בפתרון ענן.

from transformers import pipeline

pipe = pipeline("zero-shot-classification", model="joeddav/xlm-roberta-large-xnli")
print(pipe("שלום"))

הרישיון

רישיון MIT מאפשר שימוש חופשי לחלוטין, כולל שילוב במוצרים מסחריים ושינוי הקוד ללא עלות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצי המערכת שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗