GPT
R

klue/roberta-base

קוד פתוח

klueרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • roberta
  • fill-mask

אם אתם צריכים מודל שפה ייעודי לקוריאנית, זה הבסיס הסטנדרטי למשימות הבנה והשלמת טקסט. הוא קומפקטי, מהיר ורץ בקלות על כל חומרה בסיסית.

  • 111Mפרמטרים
  • 514טוקנים בהקשר
  • 845 MBמשקל הקבצים
  • 63,654הורדות בחודש

מה זה

מדובר במודל שפה שנבנה ואומן במיוחד עבור השפה הקוריאנית על בסיס ארכיטקטורת RoBERTa, עם 12 שכבות וכמאה ועשרה מיליון פרמטרים. המשימה המקורית שלו היא השלמת מילים חסרות בטקסט, fill-mask, כך שהוא לא מודל צ'אט שמייצר תשובות ארוכות אלא כלי שנועד להבין הקשר דקדוקי וסמנטי.

הוא מיועד בעיקר למי שרוצה לקחת מודל בסיס מאומן היטב בקוריאנית ולאמן אותו הלאה, למשל לסיווג טקסטים, זיהוי ישויות או ניתוח רגש. בשונה ממודלים רב-לשוניים כלליים שמכילים עשרות שפות ולעיתים מפספסים דקויות, כאן כל משאבי האימון הוקדשו לקוריאנית בלבד.

מתאים ל

  • סיווג טקסטים בקוריאנית

    בסיס קל משקל לכוונון עדין של ניתוח סנטימנט, זיהוי כוונות או מיון פניות תמיכה בשפה הקוריאנית.

  • השלמת מילים והגהה

    מילוי מילים חסרות ובדיקת תקינות הקשרית של משפטים קוריאניים קצרים באופן מדויק.

  • חילוץ ישויות ומאפיינים

    אימון שכבה עליונה לזיהוי שמות, מקומות ומונחים מתוך טקסטים קוריאניים עד אורך של 514 טוקנים.

איפה זה נופל

הוא יודע רק קוריאנית. אין לו שום תמיכה בעברית או באנגלית מעבר לרמת הבסיס, וחלון ההקשר שלו מוגבל ל־514 טוקנים, כך שטקסטים ארוכים כמו מסמכים משפטיים או ספרים יחייבו חיתוך. בנוסף, הוא לא פולט תשובות חופשיות אלא מנחש מילים מוסתרות, כך שאי אפשר להשתמש בו ישירות בתור בוט שיחה בלי אימון ייעודי.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

לא. המודל אומן באופן ממוקד לשפה הקוריאנית בלבד. אם תזינו לו טקסט בעברית הוא לא יבין את ההקשר ולא יחזיר תוצאות בעלות משמעות.

למה הטוקנייזר שלו מוגדר כ־BertTokenizer?

יוצרי המודל בנו את תהליך עיבוד הטקסט כך שהוא מתבסס על הטוקנייזר של BERT ולא על זה של RoBERTa הרגיל. שימוש ב־AutoTokenizer מספריית transformers טוען את הרכיב הנכון באופן אוטומטי בלי שתצטרכו להגדיר ידנית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בעזרת שורות קוד בודדות, כשרק צריך לשים לב להשתמש ב־BertTokenizer או פשוט ב־AutoTokenizer שטוען אותו אוטומטית. המשקל הכולל של הקבצים הוא 845 מגה-בייט בלבד, כך שלא צריך שום שרת ייעודי או כרטיס גרפי כבד כדי להריץ אותו.

אפשר להריץ אותו על מעבד רגיל בכל מחשב פיתוח מודרני, או על כרטיס מסך בסיסי וזול במיוחד אם רוצים אימון נוסף בזמנים קצרים. בממדים האלה אין שום סיבה לשלם ל־API חיצוני, כי עלויות התחזוקה העצמית אפסיות והשליטה במידע נשארת אצלכם.

from transformers import pipeline

pipe = pipeline("fill-mask", model="klue/roberta-base")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המודל. במצב כזה, מבחינה משפטית אין היתר ברור להשתמש בו במוצר מסחרי, וחובה לבדוק את תנאי השימוש במאמר המקורי או במאגר הגיטהאב של הפרויקט לפני שמשלבים אותו במערכת פעילה.

הרישיון המלא בעמוד המודל ↗