GPT
W

wikineural-multilingual-ner

קוד פתוח

Babelscapecc-by-nc-sa-4.02022-03-02

  • transformers
  • pytorch
  • tensorboard
  • safetensors
  • bert

זה מודל לזיהוי ישויות שתומך בתשע שפות אירופיות במקביל בלי להחליף משקלים. הוא שוקל מעט ומתאים למי שצריך תיוג ישויות מהיר בלי להסתבך עם מודלי ענק.

  • 177Mפרמטרים
  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 632,403הורדות בחודש

מה זה

מדובר באימון של mBERT על גבי דאטה־סט בשם WikiNEuRal שנוצר מתוך ויקיפדיה. המודל מכיל 177 מיליון פרמטרים ומיועד למשימה אחת בלבד, חילוץ ישויות כמו שמות אנשים ומיקומים מתוך טקסט. במקום להריץ מודל נפרד לכל שפה, הוא אומן במשותף על גרמנית, אנגלית, ספרדית, צרפתית, איטלקית, הולנדית, פולנית, פורטוגזית ורוסית.

הגודל הזה אומר שהוא קל מאוד יחסית לסטנדרטים הנוכחיים ומחזיר תשובות בזמני ריצה קצרים. היתרון הגדול שלו מול מודלים ישנים יותר בתחום הוא הבסיס הרב־לשוני האחוד, כך שאין צורך לנתב שפות שונות למודלים שונים בצינור העבודה שלכם. עם זאת, הוא לא מציג מדדי ביצועים ישירים בתוך הכרטיס שלו, אלא נשען על המאמר האקדמי שפורסם סביבו.

מתאים ל

  • תיוג ישויות במחקר אקדמי

    ניתוח טקסטים בכמה שפות אירופיות במקביל עבור פרויקטים ומחקרים ללא מטרות רווח.

  • עיבוד מאגרי מידע בוויקי

    חילוץ שמות ומקומות מתוך ערכים אנציקלופדיים, הסביבה הטבעית שבה המודל אומן.

  • ניסוי מקומי מהיר

    בדיקת היתכנות לצינור עיבוד שפה במחשב אישי בלי תלות בכרטיס מסך חזק.

איפה זה נופל

המודל אומן כולו על נתונים שנלקחו מוויקיפדיה. היוצרים עצמם מציינים במפורש שהוא עלול להיכשל ולא לתפקד טוב על סוגי טקסט אחרים, כמו כתבות חדשותיות, שיחות יומיומיות או מסמכים משפטיים. בנוסף, עברית בכלל לא נתמכת כאן, והקלט מוגבל לתקרה של 512 טוקנים בלבד. אם הטקסט שלכם כולל שפה לא אנציקלופדית, תצטרכו לאמן אותו מחדש על דאטה נוסף לפני שתוכלו לסמוך עליו.

שאלות
נפוצות

האם המודל יודע לזהות ישויות בעברית?

לא. המודל אומן על תשע שפות אירופיות ספציפיות ועברית אינה אחת מהן. אם תכניסו טקסט בעברית התוצאות יהיו חסרות ערך לחלוטין.

האם אפשר להשתמש בו במוצר מסחרי של החברה שלי?

לא, הרישיון אוסר על כך במפורש. השימוש מוגבל למחקר בלבד, וכל שימוש מסחרי מפר את תנאי הרישיון של המפתחים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון עם פייפליין של token-classification בכמה שורות קוד. הקבצים שוקלים 1.3 גיגה־בייט בסך הכול, כך שאפשר להריץ אותו בלי בעיה על מעבד רגיל בכל מחשב נייד או שרת בסיסי, ואין שום צורך בכרטיס מסך יקר.

בגלל המשקל הקל והפשטות שלו, אין שום סיבה לשלם לספק חיצוני על API בשביל להריץ אותו. אתם פשוט מריצים אותו מקומית או בתוך קונטיינר קטן משלכם ומקבלים שליטה מלאה על התהליך בלי עלויות שוטפות של קריאות רשת.

from transformers import pipeline

pipe = pipeline("token-classification", model="Babelscape/wikineural-multilingual-ner")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, וזה אומר שאסור להשתמש במודל לשום מטרה מסחרית. הוא מיועד למחקר בלבד. אם פיתחתם משהו שנגזר ממנו, אתם חייבים לפרסם אותו תחת אותו הרישיון בדיוק ולתת קרדיט ליוצרים. אם אתם בונים מוצר שמוכר שירות או מייצר הכנסה, אתם לא יכולים לשלב אותו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗