GPT
J

japanese-roberta-base

קוד פתוח

rinnamit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • roberta

הכלי מציע מודל RoBERTa קלאסי בגודל בסיסי של 111 מיליון פרמטרים, שמאומן ייעודית על טקסטים ביפנית בלבד. הוא מיועד למי שצריך להשלים מילים חסרות או לבנות מודל סיווג לשפה היפנית בלי לסחוב משקל עודף.

  • 111Mפרמטרים
  • 514טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 8,313הורדות בחודש

מה זה

מדובר במודל שפה מסוג Masked Language Model עם 12 שכבות וחלון הקשר של 514 טוקנים. החברה אימנה אותו במשך 15 ימים על שמונה מאיצי V100 מול מאגר הטקסטים CC-100 וערכי ויקיפדיה ביפנית, כשהטוקנייזר מבוסס על SentencePiece. הוא מגיע לערך perplexity של כ־3.9 על קבוצת בדיקה מתוך CC-100, מה שמצביע על יכולת טובה לנחש מילים שהוסתרו במשפט יפני טיפוסי.

ההבדל מול מודלים רב־לשוניים כלליים באותו סדר גודל הוא המיקוד. המילון והמשקלים הוקדשו כולם למבנה הייחודי של יפנית, במקום לחלוק את המקום עם עשרות שפות אחרות. התוצאה היא דיוק לשוני טוב יותר עבור השפה הזו בנפח קטן של 1.3 גיגה בייט.

מתאים ל

  • השלמת מילים ביפנית

    חיזוי טוקנים מוסתרים בטקסט יפני לפי הקשר תחבירי מדויק.

  • אימון מסווגים לשפה היפנית

    משמש בסיס להתאמה אישית למשימות ניתוח סנטימנט או תיוג טקסט ביפנית.

  • תיקון שגיאות הקלדה

    זיהוי מילים לא סבירות במשפט יפני ובדיקת חלופות מתאימות יותר.

איפה זה נופל

המודל מגיע עם שלוש מלכודות טכניות שהמפתחים מציינים במפורש. חובה להגדיר ידנית את מספרי המיקום מ־0, אחרת ספריית transformers מייצרת אותם מאינדקס הריפוד והפלט משתבש לחלוטין. בנוסף, חובה להוסיף את הטוקן CLS בתחילת הטקסט, ויש באג בטעינת ההגדרות של הטוקנייזר שמחייב לדרוס ידנית את do_lower_case ל־True. מי שיעביר מחרוזת פשוטה ישר למודל יקבל תוצאות שגויות.

שאלות
נפוצות

האם המודל מתאים לשיחה או לכתיבת טקסט חופשי?

לא. הארכיטקטורה שלו מיועדת למילוי מילים חסרות בתוך משפט קיים ולא ליצירת טקסט חדש ברצף כמו במודלי שיחה. אם אתם צריכים צ'אטבוט או כתיבה יוצרת ביפנית, הוא לא יעבוד לכם.

למה התחזיות יוצאות מוזרות בריצה ראשונה?

הטוקנייזר דורש הגדרות ידניות קפדניות בקוד, כולל יצירת position_ids באופן עצמאי והוספת טוקן CLS. אם תסמכו על ברירות המחדל של הספרייה, המודל יעבוד על אינדקסים שגויים ויחזיר תוצאות ירודות.

איך מריצים

כדי להריץ אותו צריך ספריית transformers בסיסית וסביבת פייתון. מודל של 111 מיליון פרמטרים שוקל 1.3 גיגה בייט בקבצים, ולכן הוא רץ בלי שום בעיה על כרטיס מסך ביתי פשוט ואפילו על מעבד רגיל של שרת זול אם זמן התגובה פחות קריטי.

הכרטיס לא מציג גרסאות מכווצות או מגוונות יותר בדף זה. אם אתם שוקלים להשתמש ב־Inference API של Hugging Face במקום להרים שרת בעצמכם, קחו בחשבון שהממשק האוטומטי הזה פחות יציב עבורו, כי הוא מתקשה עם אופן הזנת הטוקנים הייחודי שהמודל דורש.

from transformers import pipeline

pipe = pipeline("fill-mask", model="rinna/japanese-roberta-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא לעשות בו מה שתרצו, כולל שימוש מסחרי, שינוי הקוד והטמעה במוצר סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗