GPT
N

NuNER_Zero

קוד פתוח

numindmit2024-04-26

  • gliner
  • pytorch
  • safetensors
  • entity recognition
  • NER

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

זה מודל קטן לזיהוי ישויות בלי אימון מוקדם, שמתאים למי שצריך לחלץ שדות מותאמים אישית באנגלית בלי לגעת בנתוני אימון. הוא בנוי לחלץ ישויות באורך חופשי בלי לפוצץ את השרת.

  • 449Mפרמטרים
  • 3.3 GBמשקל הקבצים
  • 14,308הורדות בחודש
  • 113לייקים

מה זה

הוא מבוסס על הארכיטקטורה של GLiNER ומיועד לזיהוי ישויות בגישת zero-shot, כלומר מגדירים לו סוגי ישויות כקלט לצד הטקסט והוא מאתר אותן ישירות. בניגוד לגרסאות המקוריות של GLiNER, המימוש כאן עובד כסיווג ברמת הטוקן, מה שמאפשר לו לתפוס ישויות ארוכות מאוד בלי לחתוך אותן באמצע.

האימון נעשה על מאגר NuNER v2.0 שמשלב קטעים מתוך Pile ו־C4 עם תיוגים סינתטיים של מודלי שפה גדולים. במבחן של GLiNER הוא מציג יתרון של 3.1 אחוזים בציון F1 ברמת הטוקן מול GLiNER-large-v2.1, כך שמקבלים דיוק מעט טוב יותר מאותו סדר גודל של מודל.

מתאים ל

  • חילוץ שמות ויוזמות ארוכות

    זיהוי שמות פרויקטים וארגונים שנפרשים על פני מילים רבות בזכות סיווג ברמת הטוקן.

  • זיהוי ישויות גמיש באנגלית

    חילוץ קטגוריות משתנות לפי דרישה ממסמכים באנגלית בלי צורך לאמן את המודל מחדש.

  • תיוג ראשוני למאגרי נתונים

    יצירת דאטהסטים מתויגים במהירות על חומרה מקומית וזולה לפני אימון ייעודי.

איפה זה נופל

הוא אומן על אנגלית בלבד, כך שטקסטים בעברית לא יעבדו כאן. מגבלה טכנית קשיחה שמופיעה בתיעוד היא שכל התוויות חייבות להימסר באותיות קטנות בלבד באנגלית, אחרת הוא פשוט מפספס אותן.

בנוסף, כל הדאטהסט שלו מבוסס על תיוגים שנוצרו על ידי מודלי שפה, ולכן הטיות וטעויות של מודלים כאלה עברו ישירות לתוכו. לפני שמשלבים אותו בזרימת עבודה אמיתית, חייבים לבדוק אותו על נתונים מהעולם שלכם ולא להסתמך רק על תוצאות המבחנים הרשמיים.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. הרצה שלו על עברית תיתן תוצאות לא שמישות, ולכן תצטרכו לאמן אותו מחדש או לחפש חלופה שתומכת בריבוי שפות.

למה התוויות לא מחזירות תוצאות כמצופה?

היוצרים מציינים במפורש ששמות התוויות חייבים להיכתב באותיות קטנות בלבד באנגלית. שימוש באותיות גדולות או מעורבות ישבור את הדיוק או ימנע זיהוי לחלוטין.

איך מריצים

המודל שוקל 3.3 ג'יגה בייט וכולל כ־449 מיליון פרמטרים, גודל שרץ בלי בעיה על מעבד רגיל בשרת צנוע או על כרטיס מסך בסיסי. ההתקנה דורשת את חבילת gliner בגרסה ספציפית, 0.1.12, מה שאומר שצריך להקפיד על סביבה מבודדת כדי לא לשבור תלויות קיימות.

אם יש לכם שרת פנימי עם קצת זיכרון פנוי ועומס בינוני של מסמכים, אין שום סיבה לשלם על API חיצוני. במקרים של עומסים קיצוניים או כשאין תשתית מוכנה, שירות מנוהל יחסוך את כאב הראש של תחזוקת הסביבה.

pip install -U huggingface_hub
hf download numind/NuNER_Zero

הקבצים

7 קבצים במאגר, 3.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗