GPT
N

ner-german-large

קוד פתוח

flairרישיון לא דווח2022-03-02

  • flair
  • pytorch
  • token-classification
  • sequence-tagger-model
  • de

יש כאן גם סקירה על flair עצמו.

זיהוי ישויות בגרמנית ברמת דיוק גבוהה של 92.31 בציון F1. הוא מיועד למי שמעבד טקסטים גרמניים וצריך לחלץ שמות, מקומות וארגונים בלי להתפשר על איכות התוצאה.

  • 2.1 GBמשקל הקבצים
  • 211,316הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל ייעודי לזיהוי ישויות בגרמנית שמבוסס על ארכיטקטורת FLERT עם הטמעות XLM-R ברמת המסמך. הוא מסווג ארבע קטגוריות בלבד: אנשים, מקומות, ארגונים ושמות אחרים שנופלים להגדרה כללית. הוא לא מנסה לייצר טקסט או לנהל שיחה, אלא רץ על המשפט ומסמן את הגבולות של כל שם.

ציון ה־F1 של 92.31 במבחן CoNLL-03 הגרמני המעודכן מעיד על ביצועים יציבים מאוד בדאטהסט סטנדרטי. ההישענות על הקשר ברמת המסמך מסייעת לו להבדיל בין מילים זהות במשמעויות שונות, כמו השם ג'ורג' וושינגטון לעומת העיר וושינגטון באותו המשפט, עניין שלעיתים קרובות מפיל מודלים בסיסיים יותר שלא שומרים מספיק הקשר רחב.

מתאים ל

  • חילוץ שמות מחדשות בגרמנית

    זיהוי אנשים וארגונים בדיוק גבוה מתוך כתבות עיתונאיות וטקסטים רשמיים.

  • אנונימיזציה של מסמכים

    איתור פרטים מזהים כמו שמות ומקומות לצורך הסרת מידע רגיש ממאגרי מידע.

  • קטלוג ארכיונים לפי ישויות

    תיוג אוטומטי של מקומות וגופים בטקסטים גרמניים לטובת חיפוש וסינון מהיר.

איפה זה נופל

הוא מוגבל אך ורק לארבע ישויות ומיועד לגרמנית בלבד. אם יש לכם טקסט מעורב בעברית או באנגלית, הוא לא יזהה ישויות בשפות האלה. בנוסף, קטגוריית הישויות הכלליות כוללת בתוכה כל מה שלא נכנס לשלוש הראשיות, מה שעלול לייצר תוצאות עמומות שדורשות ניקוי ידני בהמשך. הביצועים נמדדו על סט נתונים ספציפי ואינם מבטיחים דיוק דומה בטקסט חופשי מרשתות חברתיות.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל אומן ספציפית לגרמנית ואינו מיועד לעבד עברית. הרצה שלו על טקסט עברי לא תניב זיהוי ישויות תקין.

האם אפשר להשתמש בו במוצר מסחרי?

כרגע אין רישיון מוצהר בכרטיס המודל. כל עוד המפתחים לא פרסמו תנאי שימוש מפורשים, לא מומלץ לשלב אותו במוצר מסחרי ללא בירור מולם.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית flair בפייתון ולטעון את המזהה ישירות לתוך SequenceTagger. המשקל הכולל של הקבצים עומד על 2.1 גיגה בייט, כך שאפשר תיאורטית להריץ אותו על מעבד רגיל, אבל בעיבוד כמויות טקסט עדיף להקצות לו GPU ייעודי כדי לקבל זמני תגובה סבירים.

אם אתם צריכים תיוג נקודתי לכמה מסמכים בודדים, שרת מקומי מספיק לגמרי. אם מדובר בצינור עיבוד רציף של מיליוני מסמכים בזמן אמת, אולי עדיף לשקול מודל קל יותר או שירות מנוהל כדי לא לנהל את משאבי הזיכרון בעצמכם.

pip install -U huggingface_hub
hf download flair/ner-german-large

הקבצים

5 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא דיווחו על רישיון בעמוד המודל. המשמעות פשוטה: מבחינה משפטית אין היתר שימוש ברור, לא לשימוש אישי ובטח שלא למוצר מסחרי. לפני שמטמיעים אותו בסביבת ייצור, חובה לפנות למפתחים או לבדוק את הרישיון במאגר הקוד של flair כדי לא להסתכן בהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗