GPT
B

bert-base-multilingual-cased-ner-hrl

קוד פתוח

Davlanafl-3.02022-03-02

  • transformers
  • pytorch
  • tf
  • onnx
  • safetensors

פתרון קלאסי לזיהוי ישויות בעשר שפות מרכזיות שמבוסס על mBERT. הוא מזהה אנשים, ארגונים ומקומות בלי שתצטרכו לתחזק מודל נפרד לכל שפה.

  • 177Mפרמטרים
  • 512טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 283,014הורדות בחודש

מה זה

מדובר בהתאמה של bert-base-multilingual למשימת חילוץ ישויות, שכוללת 177 מיליון פרמטרים ורצה על טקסטים בעשר שפות עתירות משאבים כמו אנגלית, ערבית, גרמנית, ספרדית וסינית. המודל מתמקד בשלוש קטגוריות בלבד: שמות אנשים, ארגונים ומיקומים גיאוגרפיים, כשהוא משתמש בסכמת תיוג שמבדילה בין תחילת ישות להמשך שלה כדי לתפוס שתי ישויות רצופות מאותו סוג.

הבסיס אומן על שילוב של מאגרי מידע ידועים כמו conll ו־ANERcorp על כרטיס V100. אין כאן הפתעות ארכיטקטוניות אלא עבודה ישירה של סיווג טוקנים עם חלון של 512 טוקנים, שמתאימה למי שרוצה ביצועים צפויים ופשוטים בעבודה רב-לשונית בלי להסתבך עם מודלי ענק.

מתאים ל

  • חילוץ שמות מכתבות בינלאומיות

    זיהוי אנשים ומקומות במאמרי חדשות בשפות כמו אנגלית וערבית, בדיוק סוג המידע שעליו המודל התחנך.

  • סינון שמות בארגוני תמיכה

    זיהוי אוטומטי של שמות לקוחות וארגונים בפניות תמיכה מרובות שפות לפני העברה לנציג.

  • תיוג ישויות במסמכים באגים

    חילוץ שמות של גופים ומיקומים מתוך מאגרי מסמכים אירופיים שמשלבים גרמנית, צרפתית או ספרדית.

איפה זה נופל

עברית לא נכללת בעשר השפות שהמודל עבר עליהן אימון יעודי, כך שהוא לא יעזור לטקסטים מקומיים בעברית. בנוסף, כל הנתונים שעליו הוא אומן הגיעו מכתבות חדשותיות ישנות יחסית, ולכן הוא מתקשה להכליל על סלנג, שפה מדוברת ברשתות חברתיות או טקסטים מקצועיים מתחומים כמו רפואה ומשפטים.

מגבלה בולטת נוספת היא מגוון הישויות. אם אתם צריכים לזהות תאריכים, סכומי כסף, מוצרים או אחוזים, הוא פשוט יתעלם מהם לחלוטין כי הוא מוגדר אך ורק לשלושה סוגים.

שאלות
נפוצות

האם המודל תומך בזיהוי ישויות בעברית?

לא. המודל אומן ספציפית על עשר שפות שאינן כוללות עברית, ולכן הוא לא יזהה בה ישויות באופן אמין.

האם צריך מחשב חזק במיוחד בשביל להריץ אותו בפרודקשן?

לא. מדובר במודל קל יחסית ששוקל 2.6 גיגה-בייט בלבד, כך שניתן להריץ אותו על מעבד רגיל או GPU קטן וזול.

איך מריצים

טוענים את המשקלים ישירות דרך pipeline של ספריית transformers לסיווג טוקנים. עם גודל קבצים של כ־2.6 גיגה-בייט, המודל רץ בלי בעיה על מעבד סטנדרטי בשרת צנוע, אבל אם יש לכם תעבורה גבוהה כדאי להצמיד לו כרטיס גרפי בסיסי כדי לקצר זמני תגובה.

אין סיבה לשלם על API חיצוני כשמדובר במודל בגודל הזה. ההרצה המקומית פשוטה, זולה ונותנת שליטה מלאה על המידע בלי להוציא טקסטים החוצה.

from transformers import pipeline

pipe = pipeline("token-classification", model="Davlan/bert-base-multilingual-cased-ner-hrl")
print(pipe("שלום"))

הרישיון

הרישיון הוא AFL 3.0, שמאפשר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, לצד מתן קרדיט והבהרה לגבי שינויים שנעשו.

הרישיון המלא בעמוד המודל ↗