GPT
B

bert-base-japanese

קוד פתוח

tohoku-nlpcc-by-sa-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זה מודל שפה ייעודי ליפנית שנבנה בארכיטקטורת BERT הקלאסית. הוא מתאים למי שחייב לעבד טקסטים ביפנית ומחפש מודל קל שמתחשב במבנה המורפולוגי הייחודי של השפה.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 177,447הורדות בחודש
  • 42לייקים

מה זה

מדובר בגרסה מקומית של BERT base עם 12 שכבות, שתוכננה ספציפית ליפנית ואומנה על כ־17 מיליון משפטים מוויקיפדיה היפנית. ההבדל המרכזי מול מודלים רב־לשוניים רגילים הוא תהליך עיבוד הטקסט. ביפנית אין רווחים בין מילים, ולכן המודל משתמש במנתח המורפולוגי MeCab עם מילון IPA לפני החלוקה לתת־מילים של WordPiece, עם אוצר מילים של 32,000 יחידות.

הוא מיועד למשימת השלמת מילים חסרות בטקסט, אבל בפועל המטרה העיקרית שלו היא לשמש בסיס לכיוונון עדין למשימות כמו סיווג טקסט, זיהוי ישויות או ניתוח סנטימנט ביפנית. המודל עוקב במדויק אחרי הגדרות האימון המקוריות של גוגל, כולל מיליון צעדי אימון וגודל חלון של 512 טוקנים.

מתאים ל

  • סיווג טקסט ביפנית

    הבסיס המורפולוגי של המודל מאפשר כיוונון עדין ומדויק למיון פניות, ביקורות ומאמרים.

  • זיהוי ישויות בטקסט

    החלוקה לפי מילון IPA מסייעת לאתר שמות, מקומות וארגונים בטקסט יפני רציף.

  • השלמת מילים חסרות

    המשימה המקורית שלו, מתאימה לבדיקת איכות טקסטים ותיקון שגיאות הקלדה.

איפה זה נופל

הנתונים שעליהם הוא אומן מגיעים מוויקיפדיה מספטמבר 2019, מה שאומר שהוא לא מכיר שום מושג, אירוע או סלנג שהופיעו מאז. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שהוא לא מתאים למסמכים ארוכים בלי פירוק מוקדם לחלקים קטנים.

התלות ב־MeCab ובמילון IPA יכולה להפוך את ההטמעה בסביבות ייצור או בקונטיינרים למסורבלת מעט. מעבר לזה, טקסט שנלקח מוויקיפדיה הוא רשמי ויבש, אז אם הדאטה שלכם כולל שפת רחוב או כתיבה חופשית ברשתות חברתיות, המודל עלול לפספס מילים.

אותה משפחה

bert-base-japanese יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסט בעברית או באנגלית?

לא. המודל אומן אך ורק על ויקיפדיה היפנית, ואוצר המילים והטוקנייזר שלו מותאמים לשפה הזו בלבד. לטקסטים מעורבים או בשפות אחרות עדיף לקחת מודל רב־לשוני.

מה נדרש כדי שהטוקנייזר יעבוד בלי שגיאות?

צריך לוודא שהתקנתם את MeCab ואת מילון IPA ברמת מערכת ההפעלה, בנוסף לחבילת הפייתון. בלי החלקים האלה הטעינה של הטוקנייזר בתוך transformers תיכשל.

איך מריצים

במשקל כולל של 1.3 גיגה־בייט, אין שום בעיה להריץ אותו מקומית אפילו על מעבד רגיל של לפטוף פיתוח מודרני, אם כי עדיף כרטיס מסך בסיסי כדי לקבל זמני תגובה טובים. הוא נתמך ישירות בספריית transformers, אבל בגלל תהליך הטוקניזציה הייחודי שלו תצטרכו לוודא שספריית MeCab ומילון IPA מותקנים ומוגדרים אצלכם בסביבה.

אם אתם צריכים רק בדיקות נקודתיות או עיבוד של כמה משפטים פעם ביום, אפשר להשתמש בשרתים מרוחקים. ברגע שיש לכם דאטה גדול לעיבוד או צורך בכיוונון עדין, אין סיבה לשלם על API חיצוני, כי הדרישות המקומיות שלו מינימליות לחלוטין.

from transformers import pipeline

pipe = pipeline("fill-mask", model="tohoku-nlp/bert-base-japanese")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

יש פה אי־התאמה שדורשת בדיקה משפטית. בעמוד המודל מדווח רישיון cc-by-sa-4.0, אבל בטקסט עצמו החוקרים מציינים את רישיון Creative Commons Attribution-ShareAlike 3.0. שני הרישיונות מאפשרים שימוש מסחרי, אבל סעיף ה־ShareAlike מחייב אתכם לשחרר כל מודל נגזר או שינוי תחת אותו רישיון בדיוק, מה שמקשה על הטמעה במוצרים קנייניים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗