GPT
N

NuNER-v0.1

קוד פתוח

numindmit2023-09-06

  • transformers
  • pytorch
  • roberta
  • feature-extraction
  • token-classification

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

בסיס קל משקל לחילוץ ישויות באנגלית שמתאים למי שרוצה ביצועי זיהוי שמות וישויות בלי להחזיק שרת יקר. הוא מבוסס על רוברטה ומייצר ייצוגים מדויקים יותר מהמקור.

  • 514טוקנים בהקשר
  • 478 MBמשקל הקבצים
  • 6,754הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל שמיועד להפקת ייצוגים וקטוריים של טוקנים לצורך זיהוי ישויות באנגלית. הבסיס שלו הוא רוברטה בייז בעל 12 שכבות, שעבר אימון ייעודי על דאטה סט של נומיינד לחילוץ שמות, מקומות וארגונים. הוא מפיק וקטורים שאפשר לקחת כמו שהם או להמשיך לאמן מעליהם ראש סיווג ספציפי למשימה שלכם.

בבדיקות שהחברה פרסמה במצבי למידה ממעט דוגמאות, המודל עוקף את רוברטה הרגיל בכל תרחיש. בדוגמה בודדת למשל הוא הגיע לתוצאה של 34.3 לעומת 24.5 של הבסיס, ובשישים וארבע דוגמאות הוא מגיע ל־68.7 מול 65.4. זה אומר שהוא מבין מבנה של ישויות מראש, כך שאתם צריכים לתייג הרבה פחות דאטה ידני כדי להגיע לתוצאה סבירה.

מתאים ל

  • בניית מסווג ישויות ייעודי

    חילוץ וקטורים איכותיים מתוך טקסטים קצרים באנגלית כדי לאמן ראש סיווג ספציפי עם מעט מאוד מידע מתויג.

  • חילוץ ישויות מקומי

    הרצה על שרתים מקומיים או מכונות קצה פשוטות ללא צורך במאיץ גרפי יקר או תשלום לפי קריאה לספק חיצוני.

  • השוואת ביצועים במחקר

    שימוש כנקודת ייחוס לבדיקת שיפורי דיוק מול גרסאות מתקדמות יותר של משפחת נונר או רוברטה הרגיל.

איפה זה נופל

החיסרון הברור ביותר הוא שמדובר בגרסה ישנה. המפתחים עצמם מציינים בדף שעדיף להשתמש בגרסה שתיים של המודל, שמשיגה תוצאות עדיפות בכל המדדים. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים, כך שאי אפשר לזרוק אליו מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות. המודל גם מוגבל לשפה האנגלית בלבד, ואינו כולל ראש סיווג מוכן שפולט ישויות ישירות, אלא מחזיר וקטורים שמחייבים אתכם לבנות שכבת החלטה מעליו.

אותה משפחה

NuNER יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה תומך בעברית?

לא. המודל אומן על אנגלית בלבד. אם תזינו לו טקסט בעברית תקבלו שגיאות או וקטורים חסרי משמעות, ועבור משימות רב־לשוניות תצטרכו לחפש גרסה אחרת של החברה שמותאמת לכך.

האם כדאי להשתמש בו לפרויקט חדש?

עדיף שלא. היוצרים הוציאו מאז את גרסאות אחת ושתיים שמציגות קפיצה משמעותית בדיוק, במיוחד במצבים של מעט דוגמאות אימון. כדאי לפנות ישירות לגרסה שתיים אלא אם אתם משחזרים ניסוי ספציפי.

איך מריצים

המשקל הכולל של הקבצים הוא 478 מגה בייט בלבד, כך שלא צריך כאן שום חומרה מיוחדת. מעבד רגיל בכל לפטופ יריץ אותו דרך ספריית הטרנספורמרס בלי בעיה, ואם שמים אותו על כרטיס גרפי בסיסי מקבלים זמני תגובה של אלפיות שניה לכל משפט.

השימוש בקוד דורש שליפת השכבות החבויות, כשהיוצרים ממליצים לשרשר את השכבה האחרונה עם השכבה השביעית מהסוף כדי לקבל דיוק מרבי, או להסתפק רק בשכבה האחרונה אם המהירות קריטית לכם. אין שום סיבה לשלם ל־API חיצוני על משימה בסדר גודל כזה, ההרצה העצמית פשוטה וזולה משמעותית.

from transformers import pipeline

pipe = pipeline("token-classification", model="numind/NuNER-v0.1")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 478 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון MIT. המשמעות היא חופש פעולה מלא, אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד, לאמן אותו מחדש ולהפיץ אותו בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗