GPT
X

xlm-roberta-large-finetuned-conll03-english

קוד פתוח

FacebookAIרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • rust
  • onnx
  • safetensors

זהו מודל רב לשוני כבד של פייסבוק שעבר כיוונון לזיהוי ישויות באנגלית. הוא מתאים למי שרוצה דיוק גבוה בחילוץ שמות ומקומות מטקסט אנגלי בעזרת תשתית רב לשונית חזקה.

  • 560Mפרמטרים
  • 514טוקנים בהקשר
  • 8.4 GBמשקל הקבצים
  • 60,045הורדות בחודש

מה זה

מדובר בגרסת הלארג' של XLM-RoBERTa, הכוללת 24 שכבות וכ־560 מיליון פרמטרים, שאומנה מראש על 2.5 טרה בייט של מידע מ־CommonCrawl במאה שפות שונות. על גבי הבסיס הזה, פייסבוק אימנו אותו ספציפית למשימת סיווג טוקנים באמצעות מערך הנתונים conll2003 באנגלית, כך שהוא מחזיר תיוגים מדויקים לישויות כמו אנשים, מיקומים וארגונים.

השילוב הזה נותן מודל שמבין מבנים לשוניים מורכבים טוב יותר ממודלים קטנים שמיועדים לאנגלית בלבד, אבל הוא דורש שתשלמו על זה במשאבים. אין כאן מודל יוצר טקסט, אלא רכיב שמקבל טקסט קצר יחסית ומחזיר את הגבולות והסוג של כל ישות שמופיעה בו.

מתאים ל

  • חילוץ שמות ומיקומים

    זיהוי אוטומטי של אנשים וערים מתוך פסקאות קצרות באנגלית עם רמת דיוק גבוהה של מודל לארג'.

  • תיוג חלקי דיבר

    ניתוח תחבירי וסיווג טוקנים ברמת המילה לטקסטים באנגלית על בסיס ארכיטקטורת RoBERTa.

  • ניקוי ישויות ממסמכים

    איתור ישויות מזוהות כדי להסיר או לטשטש פרטים אישיים בטקסטים אנגליים לפני עיבוד נוסף.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים בלבד, כך שאי אפשר לזרוק אליו מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות קודם. בנוסף, למרות שהבסיס שלו אומן על 100 שפות, הכיוונון הספציפי נעשה רק על conll2003 באנגלית, ולכן לא הייתי מסתמך עליו לחילוץ ישויות בעברית או בשפות אחרות בלי אימון נוסף.

כרטיס המודל מציין בפירוש קיומן של הטיות מובנות במערכות זיהוי ישויות באנגלית, שנוטות להיכשל בזיהוי שמות מקבוצות דמוגרפיות מסוימות. צריך לבדוק אותו מול הנתונים האמיתיים שלכם לפני שסומכים על התוצאות.

שאלות
נפוצות

האם המודל מתאים לזיהוי ישויות בעברית?

לא כפי שהוא. אמנם מודל הבסיס כולל שפות רבות, אך שכבת הסיווג אומנה אך ורק על מאגר נתונים באנגלית. אם תזינו לו טקסט בעברית, הביצועים שלו יהיו גרועים ותצטרכו לאמן אותו מחדש על דאטה מתאים.

כמה זיכרון צריך כדי להריץ אותו בפועל?

המודל שוקל 8.4 גיגה בייט בקבצים שלו, ולכן תצטרכו לפחות 12 גיגה בייט של זיכרון במעבד הגרפי כדי להעלות אותו ולהריץ עליו טקסטים בלי קריסות. לריצה על מעבד רגיל תצטרכו לפחות 16 גיגה בייט זיכרון מערכת פנוי, אבל הביצועים יהיו איטיים משמעותית.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־8.4 גיגה בייט, כך שלא מריצים אותו כלאחר יד על מחשב נייד רגיל. בשביל להריץ אותו דרך transformers עם ביצועים סבירים בזמן אמת, תצטרכו כרטיס מסך ייעודי עם מספיק זיכרון וידאו, לפחות 12 עד 16 גיגה בייט לצורך הסקת מסקנות יציבה.

אם יש לכם שרת עם מאיץ גרפי מתאים ואתם צריכים עיבוד מקומי מסיבות של פרטיות או נפח דרישות קבוע, הטעינה דרך הקוד ישירה לגמרי. אם אתם רק צריכים לתייג כמה עשרות מסמכים ביום, החזקת שרת ייעודי למודל כזה תעלה לכם יותר משימוש ב־API חיצוני של ספק ענן.

from transformers import pipeline

pipe = pipeline("token-classification", model="FacebookAI/xlm-roberta-large-finetuned-conll03-english")
print(pipe("שלום"))

הרישיון

הרישיון של המודל הזה לא דווח בכרטיס המודל הרשמי. זה אומר שמבחינה משפטית אין כרגע היתר שימוש ברור, וארגונים לא יכולים להכניס אותו למוצר מסחרי בלי לבדוק לעומק את תנאי השימוש במאגר המקורי ובמחקר המקביל של פייסבוק.

הרישיון המלא בעמוד המודל ↗