GPT
K

kf-deberta-base

קוד פתוח

kakaobankmit2023-12-13

  • transformers
  • pytorch
  • deberta-v2
  • fill-mask
  • ko

מודל שפה קוריאני קטן שמיועד לטקסטים פיננסיים ומבוסס על ארכיטקטורת DeBERTa-v2. הוא עוקף מודלים גדולים ממנו במבחני ביצועים בקוריאנית ומחזיק משקל קל של 716 מגה־בייט.

  • 512טוקנים בהקשר
  • 716 MBמשקל הקבצים
  • 17,153הורדות בחודש
  • 55לייקים

מה זה

מדובר במודל קידוד בקוריאנית שאומן במשותף על ידי KakaoBank ו־FnGuide. המפתחים אימנו אותו על שילוב של טקסטים כלליים וטקסטים מעולם הפיננסים, ובחרו בארכיטקטורת DeBERTa-v2 לאחר שמצאו ש־DeBERTa-v3 מפגין ביצועים נמוכים במשימות כמו אחזור וזיהוי יחסים. המבנה כולל 12 שכבות ומטפל בחלון הקשר של עד 512 טוקנים.

במדדי הביצועים הרשמיים המודל מציג יתרון ברור על פני חלופות מקבילות. במבחן KLUE הוא הגיע לממוצע של 82.83 ועקף אפילו את KLUE-RoBERTa בגרסת Large, שמחזיקה פי כמה יותר פרמטרים. במשימות פיננסיות ייעודיות, שכוללות סיווג כותרות, זיהוי ישויות וניתוח סנטימנט פיננסי, הוא הוביל על פני כל מתחריו בגודל Base עם ממוצע של 95.27.

מתאים ל

  • ניתוח סנטימנט פיננסי

    מזהה מגמות חיוביות ושליליות בחדשות שוק ההון בקוריאנית, עם דיוק מוכח של מעל 99% במדד FN-Sentiment.

  • חילוץ ישויות מדוחות

    מאתר שמות חברות, סכומים ומונחים פיננסיים בדיווחים עסקיים בקוריאנית ברמת דיוק גבוהה של 91.8 במדד F1.

  • סינון כתבות פרסומיות

    מבדיל בין תוכן חדשותי אמיתי לבין פרסומות מוסוות בעיתונות הכלכלית עם 97.63% הצלחה במדד הייעודי.

איפה זה נופל

החיסרון המרכזי הוא השפה וההקשר. המודל אומן אך ורק על קוריאנית, ולכן אין לו שום שימוש בניתוח מסמכים בעברית או באנגלית בלי אימון מקדים נוסף. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, מה שמקשה על עיבוד דוחות כספיים מלאים בלי לחתוך אותם לפסקאות קצרות. צריך לזכור גם שמדובר במודל מסוג Masked LM שמיועד לייצוג טקסט, חילוץ ישויות וסיווג, ולא במודל יוצר שמסוגל לכתוב תשובות או לייצר סיכומים חופשיים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לניתוח טקסטים פיננסיים בעברית או באנגלית?

לא, המודל אומן על קוריאנית בלבד. אם תזינו לו טקסט בעברית תקבלו תוצאות חסרות משמעות לחלוטין, כי אוצר המילים והמשקלים שלו לא מכירים את השפה.

האם המודל יודע לענות על שאלות ולכתוב טקסט כמו צ׳אטבוט?

לא. מדובר במודל DeBERTa לקידוד טקסט שמיועד למשימות הבנה וסיווג, כמו זיהוי ישויות וניתוח רגש. הוא לא מודל יוצר ולא מסוגל להפיק טקסט חופשי.

איך מריצים

המודל שוקל 716 מגה־בייט בלבד ורץ ישירות דרך ספריית transformers בפייתון. אין פה שום דרישה למערך שרתים כבד. כל מעבד גרפי מודרני ברמת כניסה, ואפילו מעבד מחשב רגיל עם זיכרון צנוע, יריצו אותו בלי בעיה בזמן היסק.

במשקל כזה אין סיבה אמיתית לשלם לספקי צד שלישי על קריאות API, אלא אם אתם בונים מערך שמקבל אלפי בקשות במקביל ואין לכם רצון לתחזק שרת פנימי. אם אתם מעבדים מסמכים באצוות או מנתחים דוחות, עדיף בהרבה להריץ אותו מקומית ולחסוך עלויות תעבורה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="kakaobank/kf-deberta-base")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 716 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והקוד שלו מופצים תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים. הדרישה היחידה היא שמירה על הצהרת זכויות היוצרים המקורית והפטור מאחריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗