GPT
T

t5-base-japanese

קוד פתוח

sonoisacc-by-sa-4.02022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • t5

מודל בסיס ייעודי ליפנית שמתאים למי שצריך לחלץ ייצוגים או לבצע משימות טקסט בלי לבזבז משאבים על מודל רב לשוני כבד.

  • 223Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 129,820הורדות בחודש

מה זה

המודל אומן מראש על מאגר יפני של כ־100 ג'יגה בייט שכולל את ויקיפדיה היפנית מגרסת יולי 2020, לצד נתונים מ־OSCAR ומ־CC-100. הטוקנייזר שלו מבוסס SentencePiece ואומן על כל ויקיפדיה היפנית, כך שהוא מותאם לשפה הזו מהיסוד ולא תופס מקום מיותר על שפות אחרות.

היתרון שלו בולט מול מודלים רב לשוניים כמו mt5-small של גוגל. במבחן סיווג חדשות של livedoor הוא הציג דיוק כולל של 0.97 מול 0.91 של המודל של גוגל, למרות שהוא קטן ממנו בכ־25 אחוז במספר הפרמטרים. במבחן השאלות והתשובות JSQuAD הוא מגיע לציון F1 של 0.945, מה שמראה יכולת הבנה טובה של יפנית לאחר כוונון.

מתאים ל

  • סיווג טקסטים ביפנית

    משיג דיוק של 0.97 במבחן livedoor לאחר כוונון, ועדיף על מודלים רב לשוניים.

  • מענה על שאלות ביפנית

    מגיע לציון F1 של 0.945 במבחן JSQuAD כשמאמנים אותו על המשימה.

  • חילוץ וקטורים לייצוג טקסט

    מייצר ייצוגים ממוקדים ליפנית באמצעות טוקנייזר ייעודי ובגודל חומרה קומפקטי.

איפה זה נופל

המודל עבר אימון מקדים בלבד והוא לא מוכן לשימוש ישיר כמערכת שיחה או פתרון מוכן מהקופסה. אם תריצו אותו בלי כוונון עדין על המשימה שלכם, תקבלו תוצאות חלקיות או חסרות משמעות. מגבלה נוספת היא חלון ההקשר של 512 טוקנים, שלא יתאים לטקסטים ארוכים או מסמכים שלמים ביפנית. מעבר לזה, המפתח מציין במפורש שהנתונים מאומנים על רשת פתוחה ולכן עלולים להכיל הטיות ותוכן פוגעני.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות לצ'אט?

לא. המודל עבר רק שלב אימון מקדים ולא עבר אימון על הוראות. כדי לעשות איתו משהו מועיל תצטרכו לאמן אותו על דאטה משלכם.

האם המודל תומך בעברית או באנגלית?

לא. הטוקנייזר וכל מאגרי המידע אומנו על יפנית בלבד. הוא אינו מיועד לעבודה באף שפה אחרת.

איך מריצים

המשקל הכולל של הקבצים הוא 2.5 ג'יגה בייט וגודל המודל הוא 223 מיליון פרמטרים בלבד, כך שלא צריך שרת מפלצתי. כל כרטיס מסך בסיסי עם 6 עד 8 ג'יגה זיכרון יספיק להרצה מקומית, וגם על מעבד רגיל הוא ירוץ במהירות סבירה אם אתם רק מפיקים ייצוגים.

הוא מיועד להרצה עצמית בספריית transformers ואין צורך לפנות ל־API חיצוני בתשלום, בעיקר כי מדובר במודל שדורש כוונון למשימה ספציפית לפני שהוא מחזיר ערך מעשי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="sonoisa/t5-base-japanese")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC-BY-SA 4.0 שמתיר שימוש מסחרי, אבל מחייב לתת קרדיט ליוצר ולשחרר כל נגזרת או שינוי של המודל תחת אותו רישיון בדיוק. אם אתם מתכוונים להפיץ את המשקלים המשופרים כחלק ממוצר קוד סגור, התנאי הזה הוא בעיה. בנוסף יש לעמוד בתנאי השימוש של Common Crawl.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗