GPT
S

span-marker-mbert-base-multinerd

קוד פתוח

tomaarsencc-by-nc-sa-4.02023-08-07

  • span-marker
  • pytorch
  • tensorboard
  • safetensors
  • token-classification

פתרון קל משקל לזיהוי ישויות בטקסט רב-לשוני. הוא מחלץ 15 סוגי ישויות שונים ומגיע עם דיוק כולל של 92.48 בציון F1.

  • 178Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 99,198הורדות בחודש
  • 72לייקים

מה זה

במקום להסתמך רק על סיווג כל טוקן בנפרד, המודל הזה מבוסס על ארכיטקטורת SpanMarker מעל bert-base-multilingual-cased. השילוב הזה מתמקד בזיהוי מקטעי טקסט שלמים כישויות, מה שמסייע בדיוק הגבולות של שמות מורכבים.

האימון נעשה על דאטה-סט MultiNERD ומכסה 15 קטגוריות, החל מאנשים, מקומות וארגונים, ועד מחלות, מוסדות, גרמי שמיים וכלי תחבורה. במבחנים על פני 10 שפות שונות, התוצאות מראות יציבות גבוהה. באנגלית ובגרמנית ציון ה־F1 חוצה את 94, בעוד שבסינית הוא יורד לאזור 87.02. המשמעות היא שפות אירופיות מקבלות כיסוי הדוק מאוד, אבל שפות עם מאפיינים שונים דורשות בדיקה זהירה יותר.

מתאים ל

  • סיווג ישויות במסמכים

    מזהה 15 קטגוריות ישויות בטקסטים רשמיים באנגלית ובשפות אירופיות.

  • חילוץ מידע ממאמרים

    מאתר מונחים טכנולוגיים, מחלות וגרמי שמיים מתוך טקסטים מחקריים.

  • פרויקטי מחקר רב-לשוניים

    מתאים להרצה מקומית על לפטופ רגיל לצורכי ניתוח נתונים לא מסחרי.

איפה זה נופל

המודל תלוי באותיות גדולות וקטנות. אם הטקסט שלכם מגיע משיחות צ'אט, תמלול קולי או כל מקור שלא שומר על כתיב תקני, הביצועים שלו ייפגעו. במקרה כזה היוצר עצמו ממליץ לעבור לגרסת uncased.

בנוסף, הכרטיס מציג מדידות רק עבור עשר שפות ספציפיות. עברית לא נכללת במדדים המפורטים, ולכן לא מומלץ להסתמך עליו בטקסטים מקומיים בלי לבצע בדיקת דיוק עצמאית קודם.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה לטקסטים בעברית?

עברית אמנם נתמכת עקרונית במודל הבסיס של mBERT, אך כרטיס המודל לא מציג תוצאות מדידה עליה מתוך MultiNERD. בנוסף, המודל מסתמך על אותיות גדולות כדי לזהות ישויות, מנגנון שלא קיים בעברית. לא הייתי מכניס אותו למערכת כזו בלי לבדוק ביצועים על דאטה אמיתי.

האם המודל מתאים לזיהוי ישויות במוצר מסחרי?

לא. הרישיון שבו הוא מופץ אוסר במפורש שימוש מסחרי מכל סוג. תצטרכו לאמן מודל דומה על בסיס משקל פתוח או לחפש חלופה עם רישיון מסחרי מתאים.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה-בייט עם 178 מיליון פרמטרים. זה גודל שנכנס בקלות לכל מעבד מודרני בלי להזיע, ואפשר להריץ אותו מקומית על לפטופ פיתוח או שרת זול בלי צורך במאיץ גרפי ייעודי.

כל מה שצריך זה להתקין את ספריית span_marker ולהפעיל מתוכה את המודל. כדאי לזכור שקיימת גרסה מקבילה בשם lxyuan/span-marker-bert-base-multilingual-cased-multinerd שאומנה ליותר מחזורים ומציגה ביצועים טובים יותר ברוב השפות. שווה להחזיק אותו על שרת משלכם רק אם יש לכם דרישות פרטיות או נפח עיבוד גבוה, אחרת קריאה לפתרון מנוהל חוסכת את התחזוקה.

pip install -U huggingface_hub
hf download tomaarsen/span-marker-mbert-base-multinerd

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה וחותכת: השימוש מוגבל למחקר, פיתוח פנימי ופרויקטים שאינם למטרות רווח. אסור לשלב אותו במוצר מסחרי, ואם אתם מפיצים גרסה שנגזרה ממנו, אתם מחויבים לפרסם אותה תחת אותו הרישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗