GPT
E

en_core_web_lg

קוד פתוח

spacymit2022-03-02

  • spacy
  • token-classification
  • en
  • model-index

צינור עיבוד מלא לאנגלית קלאסית עם וקטורים סטטיים מובנים. מתאים למי שצריך תיוג ישויות, תחביר ודמיון סמנטי מקומי בלי מודלי שפה ענקיים ובלי GPU.

  • 1.2 GBמשקל הקבצים
  • 1,568הורדות בחודש
  • 38לייקים

מה זה

מדובר בחבילת עיבוד שפה טבעית מקיפה לאנגלית של spaCy, שכוללת פירוק למילים, תיוג חלקי דיבר, ניתוח תחבירי, זיהוי ישויות ולמטיזציה. הייחוד של גרסת ה־lg הוא טבלת הוקטורים המלאה שהיא כוללת, עם 514,157 וקטורים ייחודיים ב־300 ממדים שאומנו על ויקיפדיה, כתוביות וחדשות. זה מאפשר לחשב דמיון סמנטי בין מילים ומשפטים ישירות מהקופסה.

במדדי הדיוק, המודל מציג מעל 99% בדיוק טוקניזציה ו־97.35% בחלקי דיבר, שזה כמעט מושלם עבור טקסט סטנדרטי. בזיהוי ישויות הדיוק עומד על ציון F1 של 85.43% על פני 18 קטגוריות שונות של OntoNotes 5, כמו ארגונים, תאריכים ושמות אנשים. זה מספיק טוב למשימות חילוץ מידע נפוצות, אם כי פחות מדויק ממודלים מבוססי טרנספורמר.

מתאים ל

  • זיהוי ישויות בטקסט אנגלי

    חילוץ שמות אנשים, ארגונים, תאריכים וסכומי כסף מתוך 18 קטגוריות מובנות בדיוק של 85.4%.

  • חישוב דמיון סמנטי מקומי

    השוואת משפטים ומילים באמצעות 514,157 וקטורי מילים ב־300 ממדים, בלי לשלוח מידע החוצה.

  • ניתוח דקדוקי ותחבירי

    פירוק משפטים לעצי תלות וחלקי דיבר בדיוק של מעל 90% לצורך הבנת מבנה הטקסט.

איפה זה נופל

הנקודה החלשה ביותר היא זיהוי ישויות, שבו הציון נע סביב 85%, מה שאומר שאחת מכל שש ישויות תפוספס או תסווג לא נכון. בנוסף, הוא מיועד אך ורק לאנגלית, כך שהוא חסר תועלת לחלוטין לטקסט בעברית. מאחר שהווקטורים שלו סטטיים ולא מבוססי הקשר עמוק כמו טרנספורמרים, משמעות של מילים עם כמה פירושים עלולה להתפספס בהקשרים מורכבים.

שאלות
נפוצות

למה לקחת את גרסת lg במקום sm או md?

הסיבה היחידה לבחור ב־lg היא טבלת הוקטורים המלאה שלו, שכוללת מעל חצי מיליון ערכים ייחודיים ב־300 ממדים. אם אתם צריכים לחשב דמיון סמנטי בין מילים ומסמכים, הגרסאות הקטנות יותר יספקו תוצאות נחותות או שלא יכללו וקטורים כלל. אם המטרה היא רק תיוג ישויות או פירוק למילים, עדיף לחסוך את הזיכרון.

האם הוא מסוגל לעבד עברית?

לא. החבילה אומנה ומיועדת אך ורק לאנגלית, בהתבסס על קורפוסים באנגלית כמו OntoNotes ו־WordNet. אם תזינו לו טקסט בעברית תקבלו תוצאות שגויות או חסרות ערך.

איך מריצים

החבילה מותאמת ישירות לריצה על מעבד רגיל ודורשת את ספריית spaCy בגרסאות שבין 3.7.2 ל־3.8.0. בגלל גודל הקבצים שעומד על 1.2 גיגהבייט והווקטורים הרבים, תצטרכו להקצות לו לפחות 1.5 עד 2 גיגהבייט של זיכרון עבודה פנוי בשרת כדי לטעון אותו.

אם אתם לא צריכים את וקטורי המילים לדמיון סמנטי ורק רוצים לזהות ישויות או מבנה משפט, אין טעם לסחוב את המשקל הזה ועדיף לקחת גרסאות קטנות יותר. שירות API חיצוני מומלץ רק אם אין לכם שרת ייעודי ואינכם רוצים להחזיק זיכרון פעיל בשביל משימות מזדמנות.

pip install -U huggingface_hub
hf download spacy/en_core_web_lg

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לפרויקטים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית של Explosion.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗