GPT
J

japanese-gpt-1b

קוד פתוח

rinnamit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • gpt2
  • text-generation

מודל שפה קומפקטי שמיועד ספציפית ליפנית ומבוסס על ארכיטקטורת GPT-2. פתרון סביר להשלמת טקסט מקומית למי שצריך תוכן ביפנית בלבד בלי מודלי ענק כלליים.

  • 1.3Bפרמטרים
  • 1,024טוקנים בהקשר
  • 4.9 GBמשקל הקבצים
  • 1,241הורדות בחודש

מה זה

מדובר במודל של מיליארד ושלוש מאות מיליון פרמטרים מבית חברת rinna, שמאומן לייצור טקסט ביפנית בלבד. הוא בנוי על ארכיטקטורה מוכרת של עשרים וארבע שכבות וגודל נסתר של 2048, ומגיע עם טוקנייזר מבוסס sentencepiece שהורחב מראש כדי לכלול גם סמלים ואימוג'ים מקומיים.

האימון נעשה על שילוב של ויקיפדיה ביפנית יחד עם גרסאות השפה של C4 ושל CC-100, כדי ללמוד חיזוי טוקנים קלאסי. המפתחים מדווחים על מדד פרפלקסיטי של בערך 14 על סט הוולידציה שלהם, מה שמראה התאמה טובה לתחביר ולדפוסי הכתיבה במאגרי הטקסט האלה.

מתאים ל

  • השלמת טקסט ביפנית

    הוא אומן על טקסט יפני נרחב ומייצר המשכים שוטפים וקוהרנטיים לפסקה התחלתית.

  • אימון נוסף למשימות נישה

    הגודל הקומפקטי מאפשר כוונון עדין על דאטה פנימי בעלות חומרה נמוכה יחסית.

  • עיבוד מקומי ללא רשת

    משקל של 4.9 גיגה מאפשר להריץ אותו ישירות על מחשב קצה או תחנת עבודה בודדת.

איפה זה נופל

המודל מיועד אך ורק לשפה היפנית, ואין לו שום תמיכה מעשית בעברית או באנגלית. חלון ההקשר שלו מוגבל מאוד ועומד על 1,024 טוקנים בלבד, מה שמונע ממנו לקרוא או לעבד מסמכים ארוכים. בנוסף, זהו מודל בסיס להשלמת טקסט ולא מודל שעבר כוונון שיחה או הוראות, ולכן הוא נוטה להמשיך משפטים ולא לענות על שאלות ישירות כעוזר אישי.

שאלות
נפוצות

האם המודל מבין או פולט עברית?

לא. המודל אומן על קורפוסים יפניים בלבד והטוקנייזר שלו מותאם לשפה הזו, כך שהוא אינו מתאים לשימוש בעברית.

איזה כרטיס מסך צריך כדי להריץ אותו?

המשקל הכולל הוא 4.9 גיגה בייט, ולכן כרטיס מסך מודרני עם 8 גיגה זיכרון מספיק בהחלט להסקה רגילה בלי צורך בחומרה ייעודית כבדה.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.9 גיגה בייט, כך שהוא נכנס בקלות לכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון גרפי, ואפשר להריץ אותו ישירות מקוד פייתון עם ספריית transformers. הטוקנייזר דורש הגדרה של use_fast כערך שקר, וקוד ההרצה הרשמי כולל חסימה ידנית של טוקן ברירת המחדל למילים לא מוכרות בזמן הדגימה.

אם אתם צריכים רק בדיקות מזדמנות ביפנית ולא רוצים להחזיק שרת דלוק, עדיף להשתמש בפתרון ענן מרוחק. הרצה מקומית משתלמת כשחייבים פרטיות מלאה לנתונים או כשרוצים להימנע מזמני השהיה ברשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="rinna/japanese-gpt-1b")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 4.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗