GPT
R

klue/roberta-large

קוד פתוח

klueרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • roberta
  • fill-mask

מודל שפה מבוסס רוברטה שמאומן ייעודית על קוריאנית. הוא רלוונטי למי שצריך להבין או לנתח טקסטים בקוריאנית ומחפש בסיס יציב למשימות סיווג ומילוי מילים חסרות.

  • 337Mפרמטרים
  • 514טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 20,990הורדות בחודש

מה זה

מדובר במודל שמיועד לשפה הקוריאנית בלבד, בארכיטקטורת RoBERTa עם 24 שכבות וסדר גודל של 337 מיליון פרמטרים. המשימה המקורית שלו היא השלמת מילים מוסתרות בטקסט, מה שאומר שהוא לא מיועד לשיחה או לייצור פסקאות מאפס, אלא נועד לשמש תשתית להבנת שפה, חילוץ מאפיינים וסיווג.

היוצרים בנו אותו במיוחד עבור בנצ'מרק ההבנה הקוריאני KLUE. בניגוד למודלים רב-לשוניים כלליים שמכילים עשרות שפות ולעיתים מפספסים דקויות תחביריות, כאן כל משקל המודל מוקדש לדקדוק ולמורפולוגיה של קוריאנית. נקודה טכנית ייחודית היא שהיוצרים דורשים להשתמש בטוקנייזר של ברט ולא בזה הרגיל של רוברטה, פרט שחשוב להגדיר נכון כדי לא לקבל פלט שבור.

מתאים ל

  • סיווג טקסט בקוריאנית

    אימון שכבת סיווג עליונה מעל הייצוגים של המודל כדי למיין ביקורות, פניות תמיכה או כתבות.

  • השלמת מילים חסרות

    שימוש ישיר במשימת המקור של המודל כדי להציע השלמות תחביריות מבוססות הקשר בתוך משפטים.

  • חילוץ ישויות ושמות

    בסיס לאימון מודל לזיהוי שמות, מקומות וארגונים מתוך טקסטים קוריאניים קצרים עד 514 טוקנים.

איפה זה נופל

המודל מוגבל לחלון הקשר קצר של 514 טוקנים, ולכן אי אפשר להזין אליו מסמכים ארוכים, חוזים או מאמרים שלמים בלי לחתוך אותם קודם. בנוסף, הוא תומך אך ורק בקוריאנית. טקסט בעברית, באנגלית או בכל שפה אחרת פשוט לא יעבוד פה, והוא לא יידע מה לעשות איתו מעבר לטוקנים שבורים.

כרטיס המודל דל בפרטים ולא כולל ציוני ביצועים, מדדי דיוק או הסברים על הטיה ורעילות בדאטה. אתם מקבלים משקלים נקיים ותצטרכו לבדוק בעצמכם איך הוא מתמודד עם שפת רחוב או סלנג לפני שמחברים אותו למערכת פעילה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעברית או לאנגלית?

לא. המודל מאומן ייעודית על קוריאנית בלבד והטוקנייזר שלו מכוון לשפה זו. כל ניסיון להזין עברית או שפות אחרות יוביל לשגיאות או לפלט חסר משמעות.

למה צריך להשתמש בטוקנייזר של ברט אם המודל הוא רוברטה?

יוצרי המודל בנו את תהליך עיבוד הטקסט סביב BertTokenizer במקום המקובל ברוברטה. שימוש ב־AutoTokenizer טוען את הרכיב המתאים אוטומטית ומונע פגיעה בתוצאות.

האם מותר להשתמש במודל בפרויקט מסחרי של החברה?

אין לכך אישור ברור כי לא דווח רישיון בעמוד המודל. מומלץ לעיין במאמר ובמאגר הגיטהאב של הפרויקט לפני שמשלבים אותו במערכת מסחרית.

איך מריצים

המודל שוקל 2.5 גיגה-בייט ומחולק לתשעה קבצים. זה גודל שמאפשר להריץ אותו בקלות על כרטיס מסך בסיסי עם 8 או 12 גיגה זיכרון, ובתרחישים של עומס נמוך אפילו על מעבד רגיל. הטעינה נעשית דרך ספריית transformers באמצעות AutoModel ו־AutoTokenizer שמזהה לבד את הצורך בטוקנייזר הנכון.

אם אתם צריכים רק לסווג כמה מאות משפטים ביום, אפשר להסתפק במכונה וירטואלית קטנה או במעבד מקומי. אם המטרה היא שירות אונליין עם זמני תגובה של אלפיות השנייה, תצטרכו כרטיס מסך ייעודי כדי שהחישוב של 337 מיליון הפרמטרים לא ייצור צוואר בקבוק.

from transformers import pipeline

pipe = pipeline("fill-mask", model="klue/roberta-large")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון בדף המודל. מבחינה משפטית זה מצב בעייתי, כי היעדר רישיון מפורש אומר שאין לכם הרשאה ברורה להשתמש בו במוצר מסחרי, להפיץ אותו או להטמיע אותו בענן של חברה. כדי לא להסתכן בתביעות זכויות יוצרים, תצטרכו לפנות לצוות KLUE או לבדוק את הרישיון במאמר המקורי לפני שאתם כותבים שורת קוד אחת למוצר אמיתי.

הרישיון המלא בעמוד המודל ↗