GPT
J

japanese-gpt2-medium

קוד פתוח

rinnamit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

מודל שפה קומפקטי שמיועד ליצירת טקסט ביפנית בלבד. הוא מתאים למי שחייב ריצה מקומית קלה וזולה, בלי תלות ברשת ועם שליטה מלאה.

  • 361Mפרמטרים
  • 1,024טוקנים בהקשר
  • 5.1 GBמשקל הקבצים
  • 3,795הורדות בחודש

מה זה

מדובר במודל GPT-2 בינוני שנבנה ואומן מאפס עבור יפנית על ידי חברת rinna. במקום לקחת מודל אנגלי ולהרחיב לו את אוצר המילים, אימנו כאן ארכיטקטורה של 24 שכבות במשך כחודש על שמונה כרטיסי V100, ישירות על מאגרי טקסט יפניים מויקיפדיה ומפרויקט CC-100.

הוא מגיע עם טוקנייזר מבוסס SentencePiece שהותאם ליפנית, ומציג תוצאת פרפלקסיטי של בערך 18 על סט הבדיקה שלו. המספר הזה מעיד על רמת ניבוי סבירה בהחלט של השפה ברמת הרצף, במיוחד בהתחשב בגודל הקטן שלו מול מודלים מודרניים.

מתאים ל

  • השלמת טקסט ביפנית

    מתאים למקלדות חכמות או מילוי אוטומטי של משפטים קצרים ביפנית בלי לצאת לרשת.

  • אימון נוסף למשימות נישה

    משמש כבסיס קל משקל לכיוונון על דאטה ייעודי ביפנית, בלי משאבי מחשוב כבדים.

  • סיווג וניתוח שפה מקומי

    רץ מקומית על שרתים פנימיים לצורך הפקת ייצוגים וניתוח טקסט יפני מאובטח.

איפה זה נופל

הוא מוגבל לחלון הקשר קצרצר של 1,024 טוקנים, מה שפוסל אותו מראש לעבודה עם מסמכים ארוכים או שיחות מתמשכות. בנוסף, הוא אומן רק על יפנית. אם תזרקו עליו אנגלית או עברית הוא פשוט יתפרק.

יש לו גם באג מוכר שמוזכר ישירות בהוראות, שמחייב דריסה ידנית של הגדרת האותיות הקטנות בטוקנייזר כדי שלא יעשה שטויות בטעינה. מעבר לזה, זה מודל בסיס ישן יחסית מ־2021 שלא עבר התאמה להוראות, אז הוא מייצר המשכי טקסט ולא עונה כמו צ'אטבוט מודרני.

שאלות
נפוצות

האם המודל מבין עברית או אנגלית?

לא, הוא מיועד ליפנית בלבד. אוצר המילים והאימון שלו הוגדרו על טקסטים יפניים, וכל ניסיון להזין שפות אחרות ייכשל לחלוטין.

למה הטוקנייזר דורש הגדרה ידנית בקוד?

יש באג ידוע בטעינת קובץ ההגדרות של הטוקנייזר הזה, ולכן המפתחים הנחו להגדיר במפורש את הפרמטר לאותיות קטנות ולבטל את הטוקנייזר המהיר.

האם הוא יענה על שאלות כמו מודל שיחה רגיל?

לא באופן טבעי. מדובר במודל השלמת טקסט קלאסי, והוא ינסה לנחש את המילים הבאות ולא להחזיר תשובה ישירה לשאלה אלא אם תאמנו אותו לזה.

איך מריצים

טוענים אותו בספריית transformers עם AutoModelForCausalLM ומגדירים את הטוקנייזר עם use_fast שווה ל־False, בגלל באג בטעינת ההגדרות שלו שמחייב גם להגדיר ידנית אותיות קטנות. קבצי המודל שוקלים 5.1 גיגהבייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי ואפילו על מעבד רגיל אם מוכנים לסבול איטיות מסוימת.

אם כל מה שאתם צריכים זה ייצור טקסט מדי פעם בלי דרישות פרטיות מקומיות, עדיף להשתמש במודל ענן גדול דרך ממשק חיצוני. החומרה והתחזוקה משתלמים רק כשאתם חייבים עיבוד מקומי או שאתם מאמנים עליו שכבה משלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="rinna/japanese-gpt2-medium")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT, מה שנותן לכם חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו מקומית או למכור שירותים שמבוססים עליו, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗