GPT
X

xlm-roberta-large

קוד פתוח

FacebookAImit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • onnx

זהו מודל ייצוג דו כיווני שאומן על מאה שפות שונות במקביל. הוא נועד בעיקר למי שצריך לחלץ תכונות טקסט או לבצע התאמה למשימות סיווג מורכבות בהרבה שפות.

  • 561Mפרמטרים
  • 514טוקנים בהקשר
  • 10.5 GBמשקל הקבצים
  • 3,380,889הורדות בחודש

מה זה

המודל הזה מבוסס על ארכיטקטורת RoBERTa ומכיל 561 מיליון פרמטרים בתוך 24 שכבות. הוא אומן בשיטה של חיזוי מילים מוסתרות מתוך טקסטים גולמיים בנפח של 2.5 טרה בייט ממאגר CommonCrawl, ללא תיוג אנושי. בגלל המבנה הדו כיווני שלו, הוא סורק את המשפט כולו יחד ולא מילה אחרי מילה כמו מודלים שיוצרים טקסט.

במקום לייצר תשובות, התפקיד שלו הוא להבין הקשר עמוק בתוך 100 שפות. הייחוד העיקרי מול מודלים קטנים יותר באותה משפחה הוא היכולת לייצר ייצוגים עשירים ומדויקים יותר לכל מילה ומשפט, מה שמשמש כבסיס יציב לאימון מסווגים על גביו.

מתאים ל

  • סיווג טקסט רב לשוני

    הוא מייצר וקטורים איכותיים להזנה לתוך מסווגים ב־100 שפות שונות.

  • תיוג ישויות ומילים

    מבנה דו כיווני שמתאים לזיהוי רכיבים וחלקים בתוך משפט נתון.

  • השלמת מילים מוסתרות

    חיזוי ישיר של מילים חסרות בטקסטים בהתבסס על ההקשר מסביב.

איפה זה נופל

הוא לא יודע לכתוב טקסט רציף או לנהל שיחה, ומי שמחפש משהו בסגנון GPT יתאכזב מיד. חלון ההקשר מוגבל ל־514 טוקנים בלבד, כך שאי אפשר להזין לו מסמכים שלמים או חוזים ארוכים בלי לחתוך אותם מראש. בנוסף, הצוות המקורי ששחרר את המודל כלל לא כתב לו כרטיס תיעוד מסודר, והדף הנוכחי נכתב על ידי Hugging Face, כך שאין פירוט על הטיות ספציפיות בדאטה של CommonCrawl.

שאלות
נפוצות

האם המודל הזה מתאים לבניית צ'אטבוט או ליצירת תוכן?

לא. המודל מאומן לחיזוי מילים מוסתרות ולא ליצירת טקסט חדש. בשביל יצירת טקסט יש לפנות למודלים אוטורגרסיביים כמו סדרת GPT.

האם אפשר להשתמש בו ישירות ללא אימון נוסף?

אפשר להשתמש בו ישירות רק למשימת fill-mask. לכל משימה אחרת כמו סיווג או מענה לשאלות, צריך לאמן מעליו שכבה נוספת.

איך מריצים

טוענים את המשקלים דרך ספריית transformers בקוד פייתון עם AutoTokenizer ו־AutoModelForMaskedLM, או משתמשים בפייפליין של fill-mask ישירות. הקבצים שוקלים 10.5 גיגה בייט, כך שצריך כרטיס מסך עם זיכרון ייעודי סביר כדי להריץ הסקת מסקנות מהירה או לבצע אימון המשך.

אם כל מה שאתם צריכים זה רק לבדוק השלמת מילים בודדות, אפשר להריץ את זה מקומית בקלות. לעומת זאת, אם אתם מתכננים אימון המשך מלא של כל 24 השכבות ואין לכם שרת ייעודי, עדיף להשתמש בתשתיות ענן מתאימות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="FacebookAI/xlm-roberta-large")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים משלכם ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗