GPT
B

bert-base-japanese-v3

קוד פתוח

tohoku-nlpapache-2.02023-05-19

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל BERT בסיסי שאומן ייעודית על טקסטים ביפנית. הוא מתאים למי שבונה משימות עיבוד שפה טבעית ביפנית וצריך בסיס אימון עם טוקניזציה מדויקת לשפה.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 128,921הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל BERT עם 12 שכבות שמכוון כולו לטקסט ביפנית. הוא לא מודל גנרטיבי שכותב פסקאות, אלא כלי לייצוג טקסט, סיווג או חילוץ מידע. ההבדל המרכזי מול מודלים רב-לשוניים רגילים הוא באופן שבו פירקו את השפה. כאן השתמשו בטוקניזציה שמבוססת על מילון Unidic 2.1.2 דרך unidic-lite ו־WordPiece, עם מסכוך מילים שלמות בזמן האימון. זה אומר שכשהמודל למד לנחש מילים חסרות, הוא הסתיר מילים שלמות ביפנית ולא חלקי תווים אקראיים.

האימון נעשה על שני מאגרים עיקריים. החלק היפני של CC-100 בגודל 74.3 ג'יגה-בייט עם כ־392 מיליון משפטים, וויקיפדיה ביפנית מגרסת ינואר 2023 בגודל 4.9 ג'יגה-בייט עם 34 מיליון משפטים. החוקרים אימנו אותו מיליון צעדים על המאגר הראשון ועוד מיליון על ויקיפדיה, מה שנותן לו בסיס חזק למבנה השפה ולמושגים עדכניים לתחילת 2023.

מתאים ל

  • סיווג טקסטים ביפנית

    כיול מהיר של שכבה עליונה לסיווג פניות תמיכה או ביקורות גולשים ביפנית.

  • חילוץ ישויות מתוך מסמכים

    זיהוי שמות וארגונים ביפנית בזכות טוקניזציה מדויקת של מילים שלמות.

  • חיפוש סמנטי ביפנית

    יצירת וקטורים של טקסטים עבור מנועי חיפוש פנימיים שפונים לקהל יפני.

איפה זה נופל

המודל מוגבל לחלון של 512 טוקנים, כך שהוא לא מתאים למסמכים ארוכים בלי חיתוך. חוץ מזה, הוא יודע רק יפנית, ואין טעם לנסות להעביר בו טקסטים מעורבים באנגלית או עברית מעבר למילים בודדות שמופיעות במאגרי הרשת.

עניין קריטי נוסף הוא שמדובר במודל בסיס שדורש כיול למשימה שלכם. בלי לאמן אותו על נתונים מסווגים שלכם לשאלות ותשובות או לקטגוריות, הוא מחזיר בעיקר ייצוגי וקטורים ומסכוך מילים, ולא מוצר שעובד ישר מהקופסה.

אותה משפחה

bert-base-japanese יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות בעברית או באנגלית?

לא. המודל אומן ספציפית על יפנית עם אוצר מילים ומילון שמתאימים רק לה. טקסטים בעברית ייכשלו בטוקניזציה לחלוטין.

איזה ספריות פייתון צריך להתקין חוץ מ־transformers?

צריך להתקין את fugashi ואת unidic-lite. הטוקנייזר של המודל משתמש בהן ישירות לפירוק המורפולוגי של הטקסט היפני לפני החלוקה לתתי-מילים.

איך מריצים

המודל שוקל 1.3 ג'יגה-בייט בספריית transformers, כך שמבחינת חומרה הוא קל מאוד לתפעול. כל כרטיס מסך בסיסי או מעבד מודרני בשרת ענן זול יריצו אותו בלי מאמץ, גם בהסקה וגם בכיול עדין.

מה שכן דורש תשומת לב הוא סביבת הריצה של הטוקנייזר. בשביל לעבוד איתו חייבים להתקין חבילות ייעודיות כמו fugashi ו־unidic-lite, כי פירוק מילים ביפנית תלוי בכלים חיצוניים ולא עובד עם ספליטר רגיל. אם אתם לא רוצים לנהל את התלויות האלה בסביבה שלכם, עדיף להרים קונטיינר מסודר או לצרוך אותו מאחורי נקודת קצה ייעודית.

from transformers import pipeline

pipe = pipeline("text-generation", model="tohoku-nlp/bert-base-japanese-v3")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון apache-2.0. זה רישיון חופשי ונוח שמאפשר שימוש מסחרי מלא, שינוי של המשקלים והפצה בתוך מוצרים סגורים. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים וצירוף עותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗