GPT
B

bert-base-japanese-whole-word-masking

קוד פתוח

tohoku-nlpcc-by-sa-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

גרסת BERT ליפנית שמאמנת מיסוך על מילים שלמות ולא על חלקי מילים. אם אתם עובדים עם יפנית ומחפשים ייצוג מדויק יותר של מורפולוגיה, זו נקודת פתיחה טובה.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 330,885הורדות בחודש
  • 76לייקים

מה זה

מדובר במודל BERT בסיסי עם 12 שכבות שאומן על טקסטים ביפנית בלבד מתוך ויקיפדיה. ההבדל המרכזי מול מודלים רגילים הוא תהליך הטוקניזציה. הטקסט עובר קודם פירוק מורפולוגי באמצעות MeCab ומילון IPA, ורק אחרי זה נחתך לתת-מילים עם WordPiece לפי אוצר מילים של 32,000 ערכים.

בנוסף, האימון למשימת מילוי מסיכות משתמש בשיטת whole word masking. במקום להסתיר חלקי מילים אקראיים, הוא מסתיר מילים שלמות שהוגדרו על ידי המנתח הלשוני. זה מכריח את המודל ללמוד את ההקשר של המילה כולה ביפנית, שפה שאין בה רווחים בין מילים, במקום לנחש תת-תו בודד מתוך תבנית צפויה.

מתאים ל

  • סיווג טקסטים ביפנית

    הבסיס המורפולוגי של MeCab נותן ייצוג מדויק לשפה נטולת רווחים.

  • השלמת מילים חסרות

    אימון המיסוך על מילים שלמות מאפשר לחזות מונחים שלמים בהקשרם.

  • חילוץ ישויות ומבנה

    12 שכבות ייצוג שמתאימות לכוונון עדין למשימות של ניתוח תחבירי.

איפה זה נופל

האימון נעשה על ויקיפדיה היפנית מגרסת ספטמבר 2019, בנפח של 2.6 גיגה-בייט וסביב 17 מיליון משפטים. זה אומר שהידע שלו נעצר שם, ושסגנון הכתיבה מוגבל לשפה אנציקלופדית רשמית. סלנג מודרני, שפת רשת או מונחים מקצועיים מתחומים שלא מכוסים היטב בוויקיפדיה יגרמו לו להתבלבל. מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים, והוא מיועד למשימות הבנה ומיסוך, לא ליצירת טקסט חופשי.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן בלעדית על ויקיפדיה ביפנית ואוצר המילים מותאם לשפה הזו בלבד. לטקסט מעורב או שפות אחרות תצטרכו מודל רב לשוני.

מה נדרש כדי להריץ את הטוקנייזר שלו?

חובה להתקין את מנתח MeCab יחד עם מילון IPA בסביבת ההרצה שלכם. בלי התלויות האלה ברמת המערכת, הטוקנייזר של המודל ייכשל עוד לפני הטעינה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers לתוך סביבת פייתון. גודל הקבצים הכולל הוא 1.3 גיגה-בייט, כך שהוא רץ בלי מאמץ על מעבד רגיל של מחשב נייד, ודורש כרטיס מסך בסיסי מאוד אם רוצים להריץ עליו כוונון עדין או לעבד אצוות גדולות.

ההתקנה דורשת תלות חיצונית בספריית MeCab ובמילון IPA כדי שהטוקנייזר יעבוד. אם הפרויקט שלכם לא מיועד לשרת עצמאי או שאין לכם כוח לנהל סביבת C ביחד עם פייתון, שירות ענן מנוהל שחוסך את הקינפוג הזה יכול להיות פתרון פשוט יותר.

from transformers import pipeline

pipe = pipeline("fill-mask", model="tohoku-nlp/bert-base-japanese-whole-word-masking")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח במטא-דאטה הוא CC-BY-SA 4.0, אם כי בכרטיס המודל נכתב CC-BY-SA 3.0. בשני המקרים מדובר ברישיון שיתוף זהה שמחייב ייחוס. מותר להשתמש בו לצרכים מסחריים, אבל כל יצירה נגזרת או מודל שאתם מכווננים עליו ומפיצים הלאה חייבים להיות מופצים תחת אותו רישיון פתוח בדיוק. אם אתם מתכננים מוצר סגור שמופץ ללקוחות, זה סיכון משפטי ברור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗