GPT
B

bert-english-uncased-finetuned-pos

קוד פתוח

vblagojeרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • bert

המודל מנתח חלקי דיבר באנגלית ברמת הטוקן על בסיס ארכיטקטורת BERT מוכרת. מי שמחפש תיוג דקדוקי מדויק וישיר לטקסט אנגלי ימצא כאן כלי ממוקד שעושה בדיוק את העבודה הזו.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 50,087הורדות בחודש

מה זה

מדובר בהתאמה של BERT למשימת סיווג טוקנים, ספציפית לצורך זיהוי חלקי דיבר באנגלית. הוא מפרק את המשפט ומתאים לכל מילה את התפקיד הדקדוקי שלה מתוך רשימה סגורה של תגיות, כמו שמות עצם, פעלים, תארי פועל, מילות יחס ומילות קישור.

במקום לקבל מודל שפה כללי שמנחש את המילה הבאה, אתם מקבלים רכיב ייעודי למבנה השפה. הוא יודע להבדיל בין שמות פרטיים לשמות עצם רגילים, לזהות סימני פיסוק ומספרים, ולסמן מילים שלא מתאימות לשום קטגוריה ברורה תחת תגית ייעודית. כרטיס המודל לא מציג תוצאות מדידה מספריות של ביצועים, כך שקשה לדעת מראש מה רמת הדיוק שלו מול מערכי נתונים סטנדרטיים.

מתאים ל

  • ניתוח תחבירי באנגלית

    זיהוי מבנה משפטים וחלקי דיבר כשלב מקדים לעיבוד שפה, חילוץ עובדות או ניתוח דקדוקי של טקסטים.

  • סינון והעשרת פיצ'רים

    חילוץ שמות עצם או פעלים מתוך מאגר טקסט כדי לשפר חיפוש פנימי או לבנות מודלים סטטיסטיים.

  • פילוח שמות וישויות

    הפרדה בין שמות פרטיים לשמות עצם רגילים במשפטים שוטפים, בתנאי שההקשר סביבם ברור.

איפה זה נופל

הוא מוגבל לטקסט באנגלית באותיות קטנות בלבד בגלל שהוא uncased, מה שאומר שהוא מתעלם לחלוטין מאותיות גדולות. זה בעייתי במיוחד בזיהוי שמות פרטיים, שלרוב נשענים על אות גדולה באנגלית כדי להתבלט. בנוסף, חלון ההקשר מוגבל לעד 512 טוקנים, אז אי אפשר לזרוק עליו מסמכים ארוכים בבת אחת בלי לחתוך אותם קודם. היוצר גם לא ציין נתוני דיוק או על איזה דאטה הוא אומן, כך שצריך לבדוק אותו עצמאית לפני שמסתמכים עליו.

שאלות
נפוצות

האם המודל מתאים לטקסט בעברית?

לא. הוא אומן אך ורק על השפה האנגלית, ולא יודע להתמודד עם שפות אחרות או עם עברית.

האם העובדה שהוא uncased פוגעת בזיהוי שמות?

כן, זה בהחלט יכול להקשות. באנגלית אותיות גדולות הן סמן מרכזי לשמות פרטיים, וכאן המודל נאלץ להסתמך רק על ההקשר של המילה במשפט.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות הארכיטקטורה המתאימה לסיווג טוקנים. המשקל הכולל יושב על קצת יותר מג'יגה בייט, כך שאין שום בעיה לדחוף אותו למעבד רגיל בשרת פשוט, ואפילו להריץ אותו לוקאלית על מחשב פיתוח בלי כרטיס מסך מיוחד.

אם אתם צריכים לנתח כמויות ענק של טקסט בזמן אמת, כרטיס מסך צנוע יספיק כדי לקבל זמני תגובה נמוכים מאוד. אין סיבה אמיתית לשלם על קריאות לשרתים חיצוניים או להסתבך עם ענן יקר כשמדובר בגודל כזה, פשוט מורידים ומריצים בתוך התשתית שלכם.

from transformers import pipeline

pipe = pipeline("token-classification", model="vblagoje/bert-english-uncased-finetuned-pos")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון לקבצים של המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, לשלב אותו באפליקציה או להפיץ אותו הלאה, במיוחד בסביבה עסקית. אם אתם בונים מוצר מסחרי, מומלץ להיזהר ולפנות ליוצר לפני שמשלבים את המודל בקוד.

הרישיון המלא בעמוד המודל ↗