GPT
R

roberta-large-NER

קוד פתוח

51la5רישיון לא דווח2022-10-17

  • transformers
  • pytorch
  • rust
  • xlm-roberta
  • token-classification

פתרון מוכן לחילוץ ישויות מטקסטים באנגלית על בסיס XLM-RoBERTa גדול. הוא מתאים למי שרוצה דיוק גבוה בזיהוי שמות, מקומות וארגונים בלי לאמן שכבת סיווג מאפס.

  • 514טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 20,417הורדות בחודש
  • 53לייקים

מה זה

מדובר במודל XLM-RoBERTa בגרסת large עם עשרים וארבע שכבות, שעבר כוונון עדין למשימת זיהוי ישויות על בסיס מאגר conll2003 באנגלית. המודל שייך למשפחת מודלי ההבנה, ולכן הוא לא מייצר טקסט חדש אלא מתייג ישירות את הטוקנים הקיימים בקלט, כמו שמות אנשים, מיקומים וארגונים.

הבסיס המקורי אומן על מאגר נתונים רב-לשוני עצום של שניים וחצי טרה-בייט מתוך CommonCrawl במאה שפות שונות, אך האימון הספציפי למשימת הזיהוי נעשה באנגלית בלבד. הכרטיס לא מציג תוצאות מדידה מספריות כמו מדד F1 מהאימון, מה שאומר שאין נתון רשמי לגבי רמת הדיוק שלו בהשוואה לגרסאות roberta-large אחרות. מי שבוחר בו מקבל ארכיטקטורה כבדה ומוכחת לשפה האנגלית עם מטען רב-לשוני ברקע.

מתאים ל

  • חילוץ ישויות מטקסט באנגלית

    זיהוי שמות, חברות ומיקומים מתוך מסמכים וכתבות באנגלית באמצעות מודל שעבר התאמה ייעודית למשימה.

  • תיוג שמות עצם וחלקי דיבר

    סיווג טוקנים במורד הזרם לניתוח תחבירי מתקדם, כשלב מקדים במערכות חיפוש וסינון מידע פנימיות.

  • עיבוד טקסטים בסביבה סגורה

    הרצה מקומית על שרת פרטי למקרים שבהם אסור להוציא נתונים לשירותי ענן חיצוניים.

איפה זה נופל

האימון הסופי נעשה על מאגר conll2003 באנגלית, ולכן המודל מיועד לטקסטים באנגלית ולא יזהה ישויות בעברית בצורה אמינה למרות הבסיס הרב-לשוני. חלון ההקשר מוגבל ל־514 טוקנים, מה שמחייב לחתוך מסמכים ארוכים לפסקאות לפני השליחה.

בנוסף, מחקרים שמצוטטים בכרטיס המודל מצביעים על הטיות מובנות בזיהוי שמות מקבוצות דמוגרפיות שונות. המפרסם לא צירף ציוני דיוק, ולכן חובה לבדוק אותו על מדגם מהדאטה האמיתי שלכם לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם המודל תומך בזיהוי ישויות בעברית?

לא. למרות שדגם הבסיס אומן על עשרות שפות, הכוונון של שכבת הסיווג בוצע באנגלית בלבד. אם תזינו טקסט בעברית, התוצאות יהיו שגויות או ריקות.

איזו חומרה צריך כדי להריץ אותו בפרודקשן?

הקבצים שוקלים 4.2 גיגה-בייט, ולכן תצטרכו כרטיס מסך עם לפחות 8 עד 16 גיגה-בייט זיכרון כדי לטעון אותו ולבצע הסקה בקצב סביר. אפשר להריץ אותו גם על מעבד רגיל, אך זמני התגובה יהיו ארוכים מדי עבור שירות חי.

איך מריצים

המודל שוקל 4.2 גיגה-בייט ורץ דרך ספריית transformers באמצעות AutoModelForTokenClassification או צינור ner מוכן. כדי להריץ אותו בזמן תגובה שפוי תצטרכו כרטיס מסך ייעודי עם לפחות 8 עד 12 גיגה-בייט זיכרון גרפי, אחרת ההסקה על מעבד תהיה אטית ומסורבלת.

אם יש לכם שרת עם מעבד גרפי ואתם מעבדים מסמכים רגישים שאי אפשר להוציא החוצה, הרצה מקומית הגיונית לגמרי. לעומת זאת, אם אתם צריכים רק תיוג מזדמן או בונים שירות בלי תשתית חומרה מתאימה, עדיף להשתמש בנקודת קצה מנוהלת או ב־API חיצוני במקום לתחזק שרת יקר בשביל מודל של מעל 4 גיגה-בייט.

from transformers import pipeline

pipe = pipeline("token-classification", model="51la5/roberta-large-NER")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 4.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. המשמעות פשוטה: אין לכם אישור משפטי מפורש להשתמש בו במוצר מסחרי, וכל שימוש כזה חושף אתכם לסיכון של הפרת זכויות יוצרים עד שהיוצר יעדכן רישיון ברור.

הרישיון המלא בעמוד המודל ↗