GPT
D

distilbert-base-multilingual-cased-ner-hrl

קוד פתוח

Davlanafl-3.02022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • distilbert

פתרון זריז לזיהוי שמות, מקומות וארגונים בעשר שפות נפוצות. הוא מבוסס על גרסה מכווצת של ברט, ולכן עולה מעט מאוד משאבים לעומת מודלים ענקיים.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 99,914הורדות בחודש

מה זה

מדובר בהתאמה ממוקדת של DistilBERT שמבצעת סיווג טוקנים לחילוץ ישויות. במקום להחזיק מודל נפרד לכל מדינה או שפה, המודל הזה אומן במקביל על עשר שפות, ביניהן אנגלית, ערבית, גרמנית, צרפתית וסינית. הוא מזהה שלושה סוגי ישויות בלבד: אנשים, ארגונים ומיקומים גיאוגרפיים, תוך הבחנה בין תחילת ישות להמשך שלה בעזרת תיוגי IOB מקובלים.

היתרון שלו על פני מודלים מלאים הוא היעילות. הוא קטן יותר ומהיר יותר מברט המקורי, בלי לוותר על התמיכה בכמה שפות עיקריות בו זמנית. הוא מאפשר לכם להריץ בדיקות וסינון טקסטים מהירים באפליקציה בלי צורך להחזיק מפלצות של מיליארדי פרמטרים, כל עוד הדאטה שלכם נופל בדיוק לשפות האלו.

מתאים ל

  • תיוג שמות בטקסטים בינלאומיים

    מזהה אנשים ומיקומים בעשר שפות שונות בלי להחליף מודל באמצע.

  • ניתוח כתבות חדשות מהרשת

    האימון שלו בוצע על דאטה חדשותי, ולכן הוא מתאים לסגנון הכתיבה הזה.

  • סינון תוכן על מעבד מקומי

    צורך מעט משאבים ומאפשר הרצה זולה בלי חומרת שרתים יקרה.

איפה זה נופל

האימון שלו נשען כולו על כתבות חדשותיות ישנות יחסית ממאגרים כמו conll ודומיהם, מטווח זמנים מוגדר. זה אומר שהוא מתקשה מאוד עם שפה חופשית ברשתות חברתיות, סלנג, או טקסטים טכניים ורפואיים. עברית בכלל לא נמצאת ברשימת השפות שבהן הוא אומן, והוא מזהה רק שלושה סוגי ישויות ולא מטפל בתאריכים, מוצרים או סכומי כסף.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. רשימת השפות שלו מוגדרת וכוללת עשר שפות ספציפיות בלבד, כמו אנגלית, ערבית, צרפתית וסינית. עברית אינה חלק מנתוני האימון שלו והוא לא מיועד לטפל בה.

למה להשתמש בו ולא במודל שפה מודרני וגדול?

הוא עובד מקומית במהירות גבוהה ובמינימום צריכת זיכרון. אם המטרה היא רק לשלוף שמות וערים בלי לשלם על מודל ענק שמייצר טקסט, הוא חוסך זמן חישוב יקר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם פייפליין של זיהוי ישויות. בגלל הגודל הקומפקטי שלו, אפשר להריץ אותו בקלות על כל מעבד מודרני בלי להחזיק כרטיס מסך ייעודי בשרת, והוא עולה לזיכרון כמעט מיד.

אם אתם מעבדים מיליוני פריטים בדקה, כרטיס מסך בסיסי יקצר את הזמנים. להשתמש בזה דרך שירות ענן חיצוני פחות משתלם כשמדובר במודל כזה קל משקל, כי החיסכון בתחזוקה עצמית מתקזז מול עלויות הרשת והקריאות החוזרות.

from transformers import pipeline

pipe = pipeline("token-classification", model="Davlan/distilbert-base-multilingual-cased-ner-hrl")
print(pipe("שלום"))

הרישיון

הרישיון הוא AFL 3.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה במוצרים שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים המקורית, צירוף עותק הרישיון, והימנעות משימוש בסימנים המסחריים של היוצרים.

הרישיון המלא בעמוד המודל ↗