GPT
K

KcELECTRA-base

קוד פתוח

beomimit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • electra
  • pretraining

מודל שפה לקוריאנית שאומן על תגובות גולשים מלוכלכות מחדשות Naver. הוא נבנה במיוחד להבנת סלנג, שגיאות כתיב ואימוג'י ברשת, איפה שמודלים רשמיים נכשלים.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 834 MBמשקל הקבצים
  • 5,377הורדות בחודש

מה זה

המודל מבוסס על ארכיטקטורת ELECTRA עם 109 מיליון פרמטרים, 12 שכבות וחלון הקשר של 512 טוקנים. הוא אומן מאפס על 17.3 גיגה בייט של טקסט המכיל מעל 180 מיליון משפטים, שנאספו מתגובות ותגובות משורשרות באתר Naver בין 2019 ל־2021. בזמן שרוב מודלי השפה בקוריאנית אומנו על ויקיפדיה, ספרים או כתבות חדשות ערוכות, כאן אוצר המילים כולל ביטויים יומיומיים, קיצורים כמו רצפי צחוק ואימוג'י.

במבחני ביצועים, ההתמחות הזו ניכרת היטב. במשימת ניתוח סנטימנט על ביקורות גולשים, המודל מגיע לדיוק של 91.71 אחוז, ועוקף מודלים כלליים מובילים כמו KoELECTRA ו־HanBERT. לעומת זאת, במשימות שדורשות הבנת שפה תקנית, כמו שאלות ותשובות או הסקת מסקנות, מודלים כמו KoELECTRA-Base-v3 משיגים ציונים גבוהים יותר באופן עקבי.

מתאים ל

  • ניתוח סנטימנט בתגובות

    משיג דיוק גבוה מאוד בזיהוי רגש בטקסט לא רשמי של משתמשים ברשת.

  • סינון תוכן ושיח פוגעני

    מזהה סלנג, קיצורים ואיות משובש שמשתמשים כותבים ברשתות חברתיות.

  • זיהוי ישויות בטקסט גולשים

    מחלץ שמות וישויות מקוריאנית מדוברת עם ציון F1 של 86.90.

איפה זה נופל

היוצר מציין במפורש שמודלים שאומנו על טקסט כללי יציגו ביצועים טובים יותר במשימות סטנדרטיות. מעבר לזה, המודל תומך בקוריאנית ובאנגלית בלבד, ואינו מתאים לעברית. טקסטים מתחת ל־10 תווים סוננו באימון, קללות צונזרו מראש במקור והוחלפו ברווחים, וחלון ההקשר מוגבל ל־512 טוקנים.

שאלות
נפוצות

האם כדאי להשתמש בו לטקסטים בעברית?

לא. המודל אומן על קוריאנית עם מעט אנגלית, ואין לו יכולת לעבד או להבין עברית כלל.

איך הוא מתמודד עם שפה רשמית ומאמרים?

הוא יעבוד, אבל פחות טוב מחלופות. אם המשימה שלכם מתבססת על מסמכים רשמיים, חדשות ערוכות או ויקיפדיה, מודל כמו KoELECTRA ייתן תוצאות מדויקות יותר.

איך מריצים

טעינת המודל נעשית ישירות דרך ספריית transformers בפייתון עם AutoModel ו־AutoTokenizer. משקל הקבצים עומד על 834 מגה בייט, כך שאפשר להריץ אותו בלי בעיה על מעבד רגיל, או על כרטיס מסך פשוט וזול עם כמה גיגה בייט של זיכרון.

בזמן העבודה צריך להשתמש בספריות נוספות כמו emoji ו־soynlp. היוצר סיפק פונקציית ניקוי מבוססת regex כדי לנרמל אותיות חוזרות ולהסיר קישורים, מה שמצמצם משמעותית טוקנים לא מוכרים. אין צורך ב־API חיצוני למודל בסדר גודל כזה, שכן הרצה מקומית תהיה מהירה וזולה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="beomi/KcELECTRA-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 834 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו בחופשיות לכל מטרה, כולל מוצרים מסחריים וקוד סגור, לשנות את המשקלים או להפיץ אותם מחדש. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗