GPT
B

bert-base

קוד פתוח

kluecc-by-sa-4.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • fill-mask

זהו מודל בסיס ייעודי לשפה הקוריאנית, שנבנה במיוחד כדי להבין את המבנה המורפולוגי שלה. הוא מיועד למי שמפתח משימות סיווג, ניתוח דקדוקי או שליפת ישויות בקוריאנית.

  • 111Mפרמטרים
  • 512טוקנים בהקשר
  • 850 MBמשקל הקבצים
  • 43,107הורדות בחודש

מה זה

המודל פותח לצד בנצ'מרק ההערכה KLUE, במטרה לתת מענה מדויק להבנת טקסט בקוריאנית. הוא אומן על קורפוס רחב של כ־62 גיגה־בייט ממקורות מגוונים, שכוללים חדשות, אנציקלופדיה מקוונת, עצומות אזרחיות וטקסטים מדוברים. הייחוד המרכזי שלו מול מודלים רב־לשוניים כלליים בגודל הזה הוא תהליך הטוקניזציה, שמבוסס על ניתוח מורפולוגי מקדים לפני חלוקת תת־מילים, מה שמסייע לו להתמודד היטב עם הדקדוק המקומי.

בבדיקות הביצועים הרשמיות הוא מציג יכולות גבוהות במיוחד בזיהוי דמיון סמנטי (ציון פירסון של 90.85) ובניתוח תחבירי (UAS של 89.96). לעומת זאת, במשימות תובעניות יותר כמו מעקב אחר מצב שיחה או חילוץ קשרים בין ישויות, הציונים שלו צונחים לאזור ה־46 עד 66 אחוזים. המשמעות היא שהוא מצוין לסיווג ולניתוח מבני, אבל דורש בדיקה מעמיקה אם אתם בונים עליו למערכות דיאלוג מורכבות.

מתאים ל

  • סיווג נושאים של כתבות

    משיג תוצאת F1 של 85.73 במאמרי חדשות קוריאניים ומתאים למיון טקסטים אוטומטי.

  • בדיקת דמיון סמנטי

    מציג מתאם גבוה במיוחד של מעל 90 אחוז בהשוואה בין משפטים שונים בקוריאנית.

  • חילוץ ישויות מטקסט

    מגיע ל־91.39 ב־F1 ברמת התווים בזיהוי שמות, מקומות וגופים בקורפוס קוריאני.

איפה זה נופל

הוא מוגבל לחלוטין לשפה הקוריאנית, ולא תפיקו ממנו שום תועלת בטקסטים בעברית או באנגלית. הכרטיס מדגיש שהמודל לא אומן להציג עובדות היסטוריות מדויקות או לייצג אירועים ואנשים באמינות, ולכן אסור להשתמש בו כמקור מידע או כמנוע יצירת תוכן עובדתי. יש לקחת בחשבון גם הטיות ומידע אישי שעלולים היו לדלוף מנתוני האימון הציבוריים, למרות ניסיונות הסינון וההסוואה שנעשו בעת בניית הקורפוס.

שאלות
נפוצות

האם המודל מתאים לשימוש בישראל בעברית?

לא. המודל אומן באופן בלעדי על נתונים בקוריאנית ומשתמש במנתח מורפולוגי ייעודי לשפה זו, כך שהוא לא יעבוד על עברית כלל.

האם הוא יכול לייצר פסקאות חדשות וטקסט חופשי?

לא, מדובר במודל מסוג Masked LM המיועד להשלמת מילים חסרות, חילוץ ייצוגים וסיווג, ולא במודל שפועל באופן אוטורגרסיבי כמו מודלי צ'אט מודרניים.

מה המשמעות של רישיון השיתוף הזהה לפיתוח קוד סגור?

אם אתם רק קוראים למודל כחלק מאפליקציה, אין בעיה. אם אתם מבצעים fine-tuning למשקלי המודל ומפיצים אותו, תצטרכו לשחרר את המשקלים החדשים ברישיון פתוח זהה.

איך מריצים

המודל שוקל כ־850 מגה־בייט ורץ דרך ספריית transformers הרגילה בפייתון. בזכות גודל של 111 מיליון פרמטרים, כל מעבד גרפי מודרני פשוט עם זיכרון צנוע יריץ אותו בקלות בזמן הסקה, ואפשר אפילו להריץ אותו על מעבד מרכזי רגיל אם השיהוי אינו קריטי.

אין שום סיבה לשלם לספקי צד שלישי על גישה ל־API בשביל מודל בגודל כזה. הוא קל משקל, יציב, ואידאלי לאירוח עצמי ישירות בתוך התשתית שלכם ללא תלות ברשת חיצונית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="klue/bert-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC-BY-SA-4.0. מותר להשתמש בו לצרכים מסחריים, אך יש חובת ייחוס ברורה ליוצרים. בנוסף, חל עקרון שיתוף זהה (ShareAlike), כלומר אם אתם משנים את המודל או מאמנים אותו הלאה, עליכם להפיץ את התוצר הנגזר תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗