GPT
L

line-distilbert-base-japanese

קוד פתוח

line-corporationapache-2.02023-03-09

  • transformers
  • pytorch
  • distilbert
  • fill-mask
  • ja

גרסה מזוקקת של מודל שפה יפני מבית LINE, שמיועדת לחילוץ ייצוגים ומשימות טקסט מהירות. הוא מתאים למי שרוצה ביצועים קרובים ל־BERT מלא בלי לבזבז זיכרון.

  • 512טוקנים בהקשר
  • 263 MBמשקל הקבצים
  • 7,011הורדות בחודש
  • 50לייקים

מה זה

המודל מבוסס על ארכיטקטורת DistilBERT עם 6 שכבות ו־66 מיליון פרמטרים, ואומן בשיטת distillation מול מודל BERT-base פנימי של LINE על 131 גיגה-בייט של טקסט יפני מהרשת. הייעוד המקורי שלו הוא השלמת מילים מוסתרות, אבל בפועל משתמשים בו כדי לחלץ וקטורים למשימות סיווג, דמיון וחיפוש ביפנית.

במבחני JGLUE מול מודלי DistilBERT יפניים מקבילים כמו Laboro ו־BandaiNamco, הוא מוביל בכל המדדים. הפער בולט בעיקר במשימות הבנת הנקרא ושאלות תשובות כמו JSQuAD, שם הוא מגיע ל־87.3 אחוז דיוק מדויק לעומת 70.2 של Laboro, וגם בהיסק לוגי הוא מציג יתרון מורגש של כמה אחוזי דיוק.

מתאים ל

  • סיווג טקסט ביפנית

    אימון שכבת ראש על גבי המודל לסיווג כוונות, תיוג מסמכים או ניתוח רגש ביפנית בצריכת משאבים נמוכה.

  • חיפוש סמנטי והטמעות

    חילוץ וקטורים מהירים להשוואת דמיון בין משפטים יפניים במערכות חיפוש שלא מצדיקות שרת GPU ייעודי.

  • מענה על שאלות מתוך טקסט

    מערכות שליפת תשובות מקומיות ביפנית, בזכות דיוק גבוה במבחני JSQuAD לעומת אלטרנטיבות בגודל דומה.

איפה זה נופל

זהו מודל ממוקד יפנית בלבד. הוא לא מבין עברית או אנגלית מעבר לטוקנים בסיסיים, וחלון ההקשר שלו מוגבל ל־512 טוקנים, כך שהוא לא מתאים למסמכים ארוכים בלי חיתוך מוקדם.

הוא גם לא מודל יוצר טקסט בסגנון שיחה, אלא מודל encoder. אם אתם צריכים צ'אטבוט או כתיבה יוצרת, זה לא הכיוון בכלל. בנוסף, התלות בספריות מורפולוגיות חיצוניות ביפנית מסבכת את בניית סביבת הריצה בשרתים מסוימים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסט בעברית?

לא. המודל אומן על טקסט יפני והטוקנייזר שלו מבוסס על מילון Unidic שמפרק מילים ביפנית. הרצה שלו על עברית תחזיר טוקנים לא מזוהים או תוצאות חסרות משמעות לחלוטין.

למה הטעינה של הטוקנייזר זורקת שגיאה?

הטוקניזציה מסתמכת על ניתוח מורפולוגי של יפנית ודורשת התקנה נפרדת של fugashi, sentencepiece ו־unidic-lite בסביבת העבודה שלכם. בנוסף, חובה להעביר לקריאה את הדגל trust_remote_code=True.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers של פייתון, אבל חובה להתקין מראש את fugashi, sentencepiece ו־unidic-lite כי הטוקניזציה תלויה ב־MeCab. בנוסף, הטעינה של הטוקנייזר דורשת את הפרמטר trust_remote_code.

במשקל קבצים של 263 מגה-בייט בלבד, אין שום סיבה לשלם על API חיצוני או להחזיק שרת יקר. הוא רץ בלי למצמץ על מעבד רגיל בכל לפטופ, בתוך קונטיינר קטן ב־cloud, או על כרטיס מסך בסיסי ביותר אם צריכים לטפל באלפי בקשות בשנייה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="line-corporation/line-distilbert-base-japanese")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצהירים על השינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗