GPT
F

finbert-tone

קוד פתוח

yiyanghkustרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • text-classification
  • financial-sentiment-analysis

מודל שמסווג סנטימנט פיננסי לשלושה מצבים בלבד, חיובי, שלילי או נייטרלי. הוא אומן ישירות על דוחות כספיים ושיחות ועידה באנגלית, בדיוק איפה שמודלי שפה כלליים מפספסים את ההקשר.

  • 512טוקנים בהקשר
  • 838 MBמשקל הקבצים
  • 791,720הורדות בחודש
  • 223לייקים

מה זה

מדובר בהתאמה של ארכיטקטורת BERT לקסיקון של שוק ההון. במקום ללמוד סנטימנט מביקורות סרטים או ציוצים, אימנו אותו על קורפוס של 4.9 מיליארד טוקנים מטקסטים פיננסיים: 2.5 מיליארד מתוך דוחות 10-K ו־10-Q, עוד 1.3 מיליארד מתמלולי שיחות רווחים, ו־1.1 מיליארד מדוחות אנליסטים. על הבסיס הזה ביצעו כוונון עדין עם 10,000 משפטים שתוייגו ידנית מדוחות אנליסטים.

המשמעות היא שהוא מבין את הניואנס של שפה חשבונאית. משפט כמו צמיחה שטוחה לא בהכרח יקבל סיווג שגוי כמו שקורה במודלים כלליים, אלא יסווג ישירות לאחת משלוש התוויות המוגדרות בו. המודל מחזיר תיוג ישיר של נייטרלי, חיובי או שלילי, בלי התפלספויות ובלי גנרציה של טקסט חופשי.

מתאים ל

  • סיווג תמלולי שיחות רווח

    פירוק השיחה למשפטים וזיהוי מהיר של שינויי טון של ההנהלה לאורך השיחה באנגלית.

  • ניתוח דוחות אנליסטים

    סינון ומיון הערכות של בתי השקעות לפי סנטימנט חיובי או שלילי בצורה עקבית.

  • סריקת חדשות פיננסיות

    בדיקת כותרות ומבזקים באנגלית כדי להבין את הכיוון הכללי של השוק בלי להריץ מודל ענק.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים, כך שאי אפשר לזרוק עליו עמוד שלם של דוח כספי בלי לחתוך את הטקסט למשפטים או פסקאות קצרות קודם לכן. בנוסף, הוא תומך באנגלית בלבד. אם תזינו לו דוחות בעברית של חברות מהבורסה בתל אביב, הוא פשוט לא יידע מה לעשות איתם. הכרטיס גם לא מציג ציוני דיוק מדויקים או מדדי ביצועים מספריים, כך שחובה לבדוק אותו על מדגם פנימי שלכם לפני שמסתמכים על הסיווג שלו.

שאלות
נפוצות

האם המודל יודע לעבוד עם טקסטים ארוכים?

לא. חלון ההקשר שלו מוגבל ל־512 טוקנים בלבד. אם תרצו לנתח דוח מלא, תצטרכו לפרק את המסמך למשפטים בודדים ולהריץ אותו בלולאה.

האם הוא מזהה מונחים פיננסיים בעברית?

לא, הוא אומן אך ורק על טקסטים באנגלית. שימוש בדוחות ישראליים מקומיים ידרוש תרגום מראש, מה שעלול לפגוע במשמעות של מונחים מקצועיים.

איך מריצים

המודל שוקל 838 מגה-בייט בסך הכול, כך שאין שום סיבה לשלם על שירות ענן חיצוני או API ייעודי עבורו. כל מחשב פיתוח בסיסי, ואפילו שרת CPU זול בלי כרטיס מסך, יכול לטעון אותו לזיכרון ולהריץ אינפרנס מהיר בלי להרגיש מאמץ.

הטעינה נעשית ישירות דרך ספריית transformers בפייתון באמצעות הצינור הרגיל של סיווג טקסט. אין פה גרסאות שונות לבחור ביניהן, פשוט מושכים את המשקולות, מעבירים מערך של משפטים, ומקבלים את התוויות.

from transformers import pipeline

pipe = pipeline("text-classification", model="yiyanghkust/finbert-tone")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 838 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא הגדירו רישיון בכרטיס המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, וזה יוצר סיכון שחברות מסודרות לא יאהבו לקחת בלי אישור מהחוקרים.

הרישיון המלא בעמוד המודל ↗