GPT
B

bert-kor-base

קוד פתוח

kykimרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל שפה קוריאני קלאסי בגודל סטנדרטי שאומן על דאטה ענקי של שבעים גיגה טקסט. הוא מתאים למי שחייב מודל מקומי לקוריאנית שרץ מהר על מעבד רגיל.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 81,863הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת ברט המוכרת עם שתים עשרה שכבות, שנועד מראש לעיבוד והשלמת טקסט בקוריאנית. המפתח אימן אותו על מאגר נתונים של שבעים גיגה בייט וטוקנייזר ייעודי של ארבעים ושניים אלף תתי מילים באותיות קטנות. זה אומר שיש לו היכרות טובה עם המבנה של השפה, בניגוד למודלים רב לשוניים כלליים שמקצים לקוריאנית חלק קטן מאוצר המילים שלהם.

בגודל כזה של גיגה ורבע הוא לא מתיימר להתחרות במודלי ענק מודרניים. המטרה שלו ממוקדת מאוד, משימות סיווג, שליפת מידע או השלמת מילים בקוריאנית בתוך סביבה שדורשת זמני תגובה מהירים בלי לשרוף תקציבי מחשוב.

מתאים ל

  • סיווג טקסט בקוריאנית

    הבסיס אומן על שבעים גיגה טקסט מקומי, מה שנותן נקודת פתיחה מצוינת לכוונון עדין לסיווג.

  • השלמת מילים חסרות

    הוא נבנה ספציפית למשימת השלמת מילים בטקסט קוריאני עם מילון מותאם של עשרות אלפי תת מילים.

  • חילוץ מאפיינים ווקטוריים

    אפשר להפיק ממנו ייצוגים מתמטיים לטקסט קוריאני שרצים מהר בלי לתפוס זיכרון רב במחשב.

איפה זה נופל

הוא מוגבל לחלון הקשר קצר של חמש מאות ושנים עשר טוקנים, כך שאי אפשר להזין לו מסמכים ארוכים בבת אחת. מעבר לזה, המודל פורסם במקור למשימת השלמת מילים בלבד ולא כמנוע שיחה, כך שהוא לא יענה לכם על שאלות חופשיות בלי שתאמנו אותו מחדש למשימה ספציפית. אין כאן תמיכה בעברית בכלל, והוא מיועד אך ורק לקוריאנית.

שאלות
נפוצות

האם המודל מבין או מייצר עברית?

לא, המודל הזה מתמחה בקוריאנית בלבד. הוא אומן על טקסטים בקוריאנית והמילון שלו נבנה לשפה הזו, כך שכל ניסיון לעבד איתו עברית פשוט לא יעבוד.

האם אפשר להשתמש בו כמו צ'אטבוט?

ממש לא, זה מודל מסוג ברט שמשלים מילים מוסתרות ולא מודל שמייצר תשובות ארוכות. אם אתם צריכים בוט שעונה למשתמשים, תצטרכו לחפש ארכיטקטורה אחרת לגמרי.

איך מריצים

טוענים אותו ישירות דרך ספריית הטרנספורמרס המוכרת באמצעות כמה שורות פשוטות בפייתון. הקבצים שוקלים קצת יותר מגיגה, כך שאין שום צורך בכרטיס מסך מפלצתי. הוא ירוץ חלק על מעבד שרת סטנדרטי או כרטיס מסך ביתי ישן, ואתם לא צריכים שום שירות ענן מיוחד בשבילו.

אם אתם רק בונים אב טיפוס ומחפשים להבין קוריאנית בכלליות, אולי עדיף לכם לשלם כמה סנטים לשימוש במודל גנרטיבי קיים. להרים מודל כזה בעצמכם משתלם בעיקר כשאתם מעבדים נפחים גדולים של טקסט מקומי ורוצים לחסוך עלויות תשתית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="kykim/bert-kor-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא פרסם רישיון שימוש בקבצים של המודל. מבחינה משפטית, כשאין רישיון מוגדר אסור להניח שמותר להשתמש בו לצרכים מסחריים או להפיץ אותו כחלק ממוצר שלכם. כל עוד המצב הזה לא משתנה, לקחת אותו לפרודקשן בחברה זה סיכון משפטי לא קטן שעדיף להימנע ממנו.

הרישיון המלא בעמוד המודל ↗