GPT
C

camembert-ner-with-dates

קוד פתוח

Jean-Baptistemit2022-03-02

  • transformers
  • pytorch
  • onnx
  • safetensors
  • camembert

זיהוי ישויות בצרפתית שמסמן גם תאריכים ולא רק שמות ומקומות. הוא מתאים למי שמעבד טקסט צרפתי ורוצה לחלץ ישויות בלי לשלם על מודל ענק.

  • 110Mפרמטרים
  • 514טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 3,568הורדות בחודש

מה זה

מדובר בהרחבה של מודל קודם לזיהוי ישויות בצרפתית, שאומנה על בסיס נתונים של ויקינר שכלל כ־170,634 משפטים. ההבדל המרכזי כאן הוא התוספת של תגית תאריכים ייעודית, מעבר לקטגוריות הרגילות של אנשים, מיקומים, ארגונים ושונות. המודל שייך למשפחת מודלי השפה הצרפתיים ומיועד לחלוקת טוקנים לקטגוריות בלבד.

בבדיקות הכלליות עם כלי הערכה ייעודי הוא הגיע לציון F1 של 0.928. זיהוי שמות ואנשים עובד בצורה המדויקת ביותר עם ציון מעל 0.95, בעוד שזיהוי ארגונים ושונות מדויק קצת פחות. לגבי תאריכים, המפתח מציין שבמבחן שכלל הודעות צ'אט ומיילים המודל הגיע לדיוק של כ־83 אחוזים, שזה שיפור מול כלים מסורתיים כמו ספריית dateparser שהגיעה באותו מבחן לכ־70 אחוזים.

מתאים ל

  • חילוץ תאריכים ממיילים

    זיהוי ביטויי זמן בטקסטים צרפתיים והעברתם לספרייה חיצונית כדי לקבוע פגישות.

  • סינון שמות ומקומות

    איתור פרטים מזהים כמו שמות אנשים וערים בהודעות צ'אט בצרפתית לצורך אנונימיזציה.

  • קטלוג מסמכים קצרים

    מיון טקסטים לפי שמות חברות וארגונים שמופיעים בהם, בריצה מקומית וזולה על מעבד.

איפה זה נופל

היוצר מציין במפורש שהמדדים של תגית התאריכים לא נמדדו באותה צורה כמו שאר הישויות, בגלל הדרך שבה הדאטה הורחב, והציון שם הוא רק הערכה סביב 90 אחוז. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים, כך שאי אפשר לזרוק אליו מסמכים שלמים בלי לחתוך אותם לפסקאות קודם. הוא גם לא ממיר את הטקסט לתאריך מובנה, אלא רק מזהה את המילים, כך שעדיין תצטרכו ספרייה חיצונית כדי להפוך את המחרוזת לאובייקט זמן אמיתי.

שאלות
נפוצות

האם המודל יחזיר לי אובייקט תאריך שאפשר לשמור ישר בבסיס הנתונים?

לא. הוא רק מסמן את המילים בטקסט שמייצגות תאריך. כדי להמיר את המחרוזת הזו לאובייקט תאריך בפייתון, צריך להעביר את הפלט שלו לספרייה כמו dateparser.

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא מומלץ בכלל. הוא אומן על צרפתית בלבד ומיועד לשפה הזו, כך שטקסט בעברית לא יקבל תיוג נכון.

איך מריצים

במשקל של 1.2 גיגה-בייט ועם 110 מיליון פרמטרים, כל מעבד סטנדרטי יריץ אותו בקלות. אתם לא צריכים כרטיס מסך ייעודי כדי לעבד איתו טקסטים, והוא נטען ישירות דרך ספריית transformers הרגילה בפייתון.

אם יש לכם שרת קטן או שאתם בונים תהליך עיבוד מקומי, אין שום סיבה לשלם לספק חיצוני על שירות כזה. אם מדובר בכמויות זניחות של פניות פעם ביום, שירות ענן חוסך תחזוקה, אבל במקרה הזה המודל קל מספיק כדי לרוץ בצד השרת שלכם בלי להכביד על הזיכרון.

from transformers import pipeline

pipe = pipeline("token-classification", model="Jean-Baptiste/camembert-ner-with-dates")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתיר כמעט הכל. מותר להשתמש בו בפרויקטים מסחריים, לשנות אותו, להטמיע אותו במוצר ולסגור את הקוד, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗