GPT
P

pos-english

קוד פתוח

flairרישיון לא דווח2022-03-02

  • flair
  • pytorch
  • token-classification
  • sequence-tagger-model
  • en

יש כאן גם סקירה על flair עצמו.

תיוג חלקי דיבר באנגלית ברמת דיוק גבוהה ובמשקל נוצה. מודל מבוסס תווים ו־LSTM שמיועד לעיבוד טקסט ישיר בלי להחזיק מודלי שפה ענקיים.

  • 238 MBמשקל הקבצים
  • 26,861הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל ברירת המחדל של ספריית flair למשימת תיוג חלקי דיבר באנגלית. הוא מבוסס על שילוב של שיכוך תווים ייעודי עם ארכיטקטורת LSTM ו־CRF, מה שמקנה לו הבנה טובה של מבנה המילים וההקשר התחבירי שלהן. המודל מתמקד בסיווג מפורט ומזהה מגוון רחב של תגיות, החל משמות עצם, פעלים בצורות זמן שונות, תארים ומילות יחס, ועד לכתובות אימייל או סימני פיסוק חריגים.

בבדיקות מול מערך הנתונים Ontonotes הוא השיג ציון F1 של 98.19. המספר הזה מעיד על כך שבטקסט סטנדרטי הוא כמעט לא מפספס, ומבצע את העבודה ברמת אמינות גבוהה ביותר למשימות בלשניות קלאסיות. השוני המרכזי בינו לבין מודלים מודרניים אחרים טמון בעובדה שהוא אינו שנאי כבד, אלא מודל רציפי ממוקד שתוכנן לתת תוצאה מהירה ומדויקת על גבי טקסטים באנגלית בלי להעמיס על התשתית.

מתאים ל

  • חילוץ תכונות בלשניות

    זיהוי שמות עצם, פעלים ותארים לצורך ניתוח תחבירי מהיר ומדויק באנגלית.

  • סינון וניקוי טקסט מקדים

    זיהוי כתובות אימייל, סימנים וחלקי דיבר כשלב הכנה למודלים אחרים.

  • עיבוד מקומי במשאבים נמוכים

    הרצה ישירה על CPU בשרתים פשוטים בלי להחזיק כרטיס גרפי יקר.

איפה זה נופל

הבעיה הבולטת ביותר היא השפה. המודל מאומן על אנגלית בלבד, וטקסט בעברית או בכל שפה אחרת פשוט לא יעבוד בו. מעבר לכך, הארכיטקטורה שלו מבוססת על LSTM ושיכוך תווים של flair, מה שאומר שטקסטים ארוכים במיוחד או מבנים תחביריים מפותלים של שיחה לא רשמית עלולים להניב שגיאות. אם המערכת שלכם עוסקת בניתוח ביטויים סלנגיים קיצוניים או מונחים מקצועיים חדשים, שווה לבדוק ידנית את התגיות שהוא מחזיר לפני שמתבססים עליו בצנרת הנתונים.

שאלות
נפוצות

האם המודל יודע לתייג מילים בעברית?

לא. המודל מאומן ספציפית על אנגלית ומיועד לשפה זו בלבד. ניסיון להזין לו עברית יניב תוצאות שגויות או חסרות משמעות לחלוטין.

האם אני חייב כרטיס מסך כדי להשתמש בו?

ממש לא. המודל שוקל 238 מגה בייט בלבד ומבוסס על LSTM, כך שמעבד רגיל מריץ אותו במהירות גבוהה בלי שום בעיה.

איך מריצים

כדי להריץ אותו מייבאים את SequenceTagger מתוך הספרייה של flair, טוענים את המזהה שלו ומעבירים לו משפט לעיבוד. חבילת הקבצים שוקלת כולה 238 מגה בייט, כך שאין שום צורך בחומרת GPU ייעודית, והוא רץ בצורה חלקה ומהירה על גבי כל מעבד סטנדרטי בשרת או במחשב פיתוח מקומי.

אין כאן גרסאות שונות לבחירה או אפשרויות כוונון מורכבות שמפורטות בעמוד שלו. בגלל שמדובר במודל קטן כל כך, אין שום סיבה להשתמש ב־API חיצוני או לשלם על שירות מרוחק, עדיף פשוט להוריד את המשקולות ישירות לסביבת הפייתון שלכם ולהריץ מקומית בלי תלויות ברשת.

pip install -U huggingface_hub
hf download flair/pos-english

הקבצים

5 קבצים במאגר, 238 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון כלל. המשמעות עבורכם היא חוסר ודאות משפטית מוחלטת, ולכן אסור להניח שמותר לשלב אותו במוצר מסחרי. לפני שמכניסים אותו לפרויקט עסקי, תצטרכו לבדוק את הרישיון של פרויקט המקור בספריית flair או ליצור קשר עם היוצרים כדי לא להסתכן בהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗