GPT
N

NuNER-v2.0

קוד פתוח

numindmit2024-04-26

  • transformers
  • safetensors
  • roberta
  • feature-extraction
  • token-classification

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

מודל קומפקטי שמייצר ייצוגים לזיהוי ישויות באנגלית ומביס מודלי שפה ענקיים במעט דוגמאות. פתרון מדויק וזול לחילוץ מידע שלא דורש שרתים מנופחים.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 479 MBמשקל הקבצים
  • 7,750הורדות בחודש

מה זה

מדובר בהתאמה של רוברטה בייס לחילוץ ישויות, שאומנה בלמידה ניגודית על דאטה רחב שתוייג בעזרת מודלי שפה גדולים. המודל שוקל פחות מחצי גיגה ומפיק וקטורים שמזהים גבולות וסוגי ישויות בטקסט אנגלי.

היתרון הגדול שלו מתבטא במצבים שבהם אין לכם כמעט דוגמאות מתויגות. בבדיקות עם דוגמה בודדת לכל מחלקה הוא מגיע לציון של 43.6 לעומת 24.5 של רוברטה הרגילה, ובאימון של שמונה עד שש עשרה דוגמאות הגרסה הקודמת שלו כבר עקפה מודל ייעודי של שבעה מיליארד פרמטרים. המשמעות פשוטה: אפשר להגיע לדיוק של מודל ענק בלי לשלם על זמני תגובה כבדים או משאבי מחשוב מוגזמים.

מתאים ל

  • חילוץ ישויות מאפס דאטה

    מאפשר לסווג שמות, חברות ומקומות באנגלית גם כשיש לכם רק דוגמאות בודדות לאימון.

  • עיבוד מקדים של פסקאות

    מתאים לשליפת וקטורים מהירה וקלת משקל כחלק מצינור עיבוד נתונים שרץ מקומית על המעבד.

  • החלפת מודלי שפה כבדים

    חוסך עלויות שרתים כשצריך רק זיהוי ישויות מהיר וממוקד במקום תשובות ממודל של 7B.

איפה זה נופל

הוא מוגבל לאנגלית בלבד, כך שאם יש לכם טקסטים בעברית או מסמכים מעורבים הוא פשוט לא יעבוד ותצטרכו לחפש גרסה רב־לשונית. מעבר לכך, חלון ההקשר עומד על 514 טוקנים, מה שאומר שאי אפשר לזרוק אליו חוזים או מאמרים שלמים בלי לחתוך אותם לפסקאות קודם.

בנוסף, הוא מייצר וקטורים ולא פולט ישויות ישירות בטקסט כמו מודל שיחה, אז תצטרכו לבנות סביבו את הלוגיקה שמפענחת את המידע בפועל.

אותה משפחה

NuNER יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מזהה טקסטים בעברית?

לא, המודל אומן על אנגלית בלבד ולא יזהה ישויות בעברית. ליוצרים יש גרסה רב־לשונית נפרדת שמתאימה לתרחישים כאלה.

האם אפשר להריץ אותו בלי שרת עם כרטיס מסך?

כן, גודל של 125 מיליון פרמטרים ומשקל של 479 מגה־בייט מאפשרים הרצה חלקה על מעבד רגיל. אין חובה להחזיק כרטיס גרפי כדי לקבל זמני תגובה טובים.

איך מריצים

טוענים אותו ישירות דרך ספריית טרנספורמרס ומעבירים טקסט כדי לשלוף את שכבת המצב הנסתר האחרונה. אפשר להשתמש בווקטורים ישר מהקופסה או להוסיף מעליו שכבת סיווג דקה ולאמן אותה על המידע שלכם.

בזכות גודל של כ־125 מיליון פרמטרים בלבד, אפשר להריץ אותו בקלות על מעבד רגיל, לפטוף מפתח, או כרטיס גרפי בסיסי וזול בלי להרגיש בעיות זיכרון. אין סיבה לקרוא ל־API חיצוני או להחזיק מודלי ענק יקרים בענן בשביל משימת חילוץ כזאת, כשהרצה עצמית כאן עולה גרושים ומחזירה תוצאות מהר מאוד.

from transformers import pipeline

pipe = pipeline("token-classification", model="numind/NuNER-v2.0")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 479 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, לאמן עליו הלאה ולשלב אותו בקוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗