GPT
X

xlm-v-base

קוד פתוח

facebookmit2023-02-03

  • transformers
  • pytorch
  • xlm-roberta
  • fill-mask
  • multilingual

מודל שפה רב לשוני שמיועד למשימות השלמת מילים והבנת טקסט. היתרון המרכזי שלו הוא אוצר מילים עצום של מיליון טוקנים, שפותר בעיות פירוק מילים בשפות שונות.

  • 514טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 7,211הורדות בחודש
  • 40לייקים

מה זה

במקום לחלוק אוצר מילים מצומצם בין עשרות שפות, כאן הגדילו את המילון למיליון טוקנים שלמים. המודל אומן על 2.5 טרה-בייט של נתוני Common Crawl, בדיוק כמו XLM-R הוותיק, אבל החלוקה הפנימית נותנת ייצוג נפרד ועמוק יותר לכל שפה בלי לכפות שיתוף טוקנים מיותר בין שפות רחוקות.

התוצאה הישירה של המילון הרחב היא ייצוג קצר ומדויק יותר של משפטים בזמן טוקניזציה. לפי המאמר של פייסבוק, המבנה הזה עוקף את XLM-R בכל מבחן שנבדק, כולל הסקת מסקנות ב־XNLI, זיהוי ישויות ב־WikiAnn ומענה על שאלות ב־MLQA ו־TyDiQA, וזה בולט במיוחד בשפות עם מעט משאבים.

מתאים ל

  • השלמת מילים וטקסט חסר

    מילון ענק מאפשר השלמת טוקנים מדויקת וטבעית יותר בעשרות שפות שונות.

  • בסיס לסיווג וזיהוי ישויות

    עוקף את הדור הקודם במשימות זיהוי שמות וישויות בזכות ייצוג מורפולוגי עשיר.

  • מענה על שאלות רב לשוני

    מתאים לכוונון על מאגרי שאלות ותשובות שדורשים דיוק בהבנת השאילתה.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים בלבד, מה שפוסל אותו מיידית לעיבוד מסמכים ארוכים או חוזים בלי חלוקה מורכבת לפסקאות. צוות הפיתוח המקורי של פייסבוק אפילו לא כתב כרטיס מודל מלא והפנה למגבלות של XLM-R, מה שאומר שההטיות של Common Crawl נמצאות כאן במלואן. בנוסף, זה מודל מסוג מסיכה שמנחש מילים חסרות, הוא לא מודל יוצר שמנהל שיחה או מייצר טקסט חופשי.

שאלות
נפוצות

האם המודל מתאים לפיתוח צ'אטבוט?

לא. הארכיטקטורה כאן היא Masked LM ולא מודל שמייצר טקסט ברצף. הוא יודע לקבל משפט, לחזות מילה מוסתרת או לייצר וקטורים למשימות סיווג, לא לענות למשתמשים בשיחה.

במה הוא עדיף על פני XLM-RoBERTa המקורי?

ההבדל העיקרי נמצא באוצר המילים של מיליון טוקנים לעומת רבע מזה בדגם הישן. זה מונע חיתוך מילים לחתיכות קטנות מדי ומשפר ישירות את התוצאות בהבנת שפות שאינן אנגלית.

איך מריצים

המשקל הכולל של הקבצים עומד על שלושה גיגה-בייט, כך שאפשר להריץ אותו ישירות בספריית transformers עם פקודת pipeline פשוטה למשימת fill-mask. בשביל להריץ אותו מקומית או בסביבת פיתוח מספיק מעבד גרפי בסיסי עם ארבעה עד שישה גיגה זיכרון, והוא רץ בלי בעיה גם על מעבד רגיל אם לא לוחצים על זמני תגובה של אלפיות שניה.

אם אתם צריכים רק בדיקות נקודתיות או שאין לכם תשתית ענן מנוהלת, אין טעם להקים שרת ייעודי בשבילו. שווה להרים אותו לבד רק אם אתם מתכוונים לעשות לו fine-tuning למשימת סיווג או חילוץ מידע ייעודית בארגון.

from transformers import pipeline

pipe = pipeline("fill-mask", model="facebook/xlm-v-base")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 3.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, שזה הרישיון הכי פתוח ונוח שיש. מותר לקחת את המשקלים, להכניס למוצר מסחרי, לשנות את הקוד ולהריץ בכל תשתית שתבחרו, גם בלי לחשוף את קוד המקור שלכם. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית והפטור מאחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗