GPT
C

camembert-ner

קוד פתוח

Jean-Baptistemit2022-03-02

  • transformers
  • pytorch
  • onnx
  • safetensors
  • camembert

זיהוי ישויות בצרפתית מתוך טקסטים לא מסודרים כמו מיילים והודעות צ'אט. הוא מכיר שמות ומקומות גם כשהמשתמש שכח לשים אות גדולה בתחילת המילה.

  • 110Mפרמטרים
  • 514טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 82,439הורדות בחודש

מה זה

מדובר במודל שמבוסס על camemBERT ועבר אימון ייעודי על מאגר wikiner-fr שמכיל סביב 170,634 משפטים. המטרה שלו ממוקדת מאוד, סיווג של כל מילה לאחת מארבע קטגוריות: שמות אנשים, ארגונים, מיקומים וישויות כלליות, לצד תיוג של מילים רגילות כחסרות ישות.

בבדיקות מול נתוני צ'אט ודואר אלקטרוני הוא הציג יתרון מורגש, בעיקר מול ישויות שנכתבו באותיות קטנות בלבד. במדד הכולל הוא מגיע לציון F1 של קרוב ל־0.89. כשמסתכלים פנימה רואים שאת שמות האנשים הוא תופס ברמת דיוק ורגישות גבוהה של סביב 0.94 עד 0.95, אבל בארגונים ובישויות כלליות התוצאות צונחות לאזור ה־0.81, כך ששם הוא מפספס יותר.

מתאים ל

  • סינון שמות ממיילים בצרפתית

    זיהוי שמות אנשים בדיוק של מעל 93 אחוז, גם כשהכותב מקליד מהר ובאותיות קטנות.

  • זיהוי מיקומים בצ'אטים

    שליפת שמות ערים ואתרים מתוך שיחות תמיכה בצרפתית בלי צורך בטקסט ערוך ומסודר.

  • הכנת דאטה למודלים אחרים

    חילוץ ישויות ומבנים מטקסט גולמי, בדיוק כמו במקרה של זיהוי חתימות מייל.

איפה זה נופל

הוא מוגבל ל־514 טוקנים ומיועד לצרפתית בלבד, כך שטקסטים ארוכים או מסמכים מעורבים בעברית או באנגלית לא רלוונטיים כאן. מעבר לזה, הזיהוי של ארגונים וישויות כלליות חלש משמעותית מזיהוי אנשים, עם F1 של פחות מ־0.82. אם המערכת שלכם נשענת על שליפת שמות חברות במדויק, תצטרכו לבדוק את התוצאות ידנית לפני שאתם סומכים עליו.

שאלות
נפוצות

האם הוא מתאים לטקסטים בעברית?

לא. המודל אומן על צרפתית בלבד ומבוסס על שפה זו. הרצה שלו על טקסט עברי לא תיתן תוצאות בעלות משמעות.

האם צריך כרטיס מסך חזק כדי להריץ אותו?

ממש לא. מדובר ב־110 מיליון פרמטרים בלבד, גודל זעיר במונחי עיבוד שפה. שרת פשוט עם מעבד רגיל יריץ אותו בקצב מספק לרוב השימושים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers למשימת token classification. עם 110 מיליון פרמטרים ומשקל קבצים של 1.2 גיגה בייט, מדובר במודל קל משקל שלא מצריך חומרה מיוחדת. אפשר להריץ אותו בקלות על מעבד רגיל של שרת מקומי, וכרטיס מסך בסיסי יספיק למהירויות גבוהות.

אם אתם צריכים לנתח זרם של פניות לקוחות או הודעות פנימיות בצרפתית, אין שום סיבה לשלם על API חיצוני. המודל קטן מספיק כדי לשבת ישירות בתוך הקוד שלכם.

from transformers import pipeline

pipe = pipeline("token-classification", model="Jean-Baptiste/camembert-ner")
print(pipe("שלום"))

הרישיון

רישיון MIT פשוט ומתירני. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו חופשי, בתנאי שמשאירים את הקרדיט והצהרת הרישיון המקורית של Jean-Baptiste.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗