GPT
F

FinancialBERT-Sentiment-Analysis

קוד פתוח

ahmedrachidרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • bert
  • text-classification
  • financial-sentiment-analysis

מודל שמסווג סנטימנט בטקסטים פיננסיים לשלוש קטגוריות. הוא מתאים למי שצריך ניתוח מדויק של חדשות שוק באנגלית בלי להחזיק שרתים כבדים.

  • 512טוקנים בהקשר
  • 419 MBמשקל הקבצים
  • 11,589הורדות בחודש
  • 98לייקים

מה זה

מדובר בהתאמה של BERT שאומן מראש על טקסטים פיננסיים ועבר כוונון ייעודי לניתוח סנטימנט על מאגר Financial PhraseBank, שמכיל 4,840 משפטי חדשות. הוא מחזיר שלוש תוצאות אפשריות: חיובי, שלילי או ניטרלי. בניגוד למודלי שפה כלליים שלא מבינים את המשמעות של ירידת תשואות או קיצוץ דיבידנד, כאן אוצר המילים מותאם ישירות לשוק ההון.

בבדיקות של היוצר הוא השיג דיוק משוקלל וציון F1 של 0.98 על סט המבחן. המשמעות היא שכמעט ואין לו פספוסים בסיווג הטון בחדשות שדומות למאגר האימון, והוא עוקף מודלים כלליים של BERT באותה משימה בדיוק. היתרון הגדול פה הוא המיקוד, בלי הזיות ובלי לנסח תשובות ארוכות.

מתאים ל

  • סיווג מבזקי שוק באנגלית

    זיהוי מיידי של כותרות כלכליות כחיוביות או שליליות בזמן אמת, בזכות אימון ספציפי על שפת המסחר.

  • סינון פידים של מניות

    מעבר על כמויות של ציוצים ועדכונים קצרים כדי לסמן מגמות סנטימנט סביב ניירות ערך מסוימים.

  • ניתוח משפטים מתוך דוחות

    פירוק דוחות כספיים למשפטים בודדים ובדיקת הטון של כל היגד בנפרד, כל עוד לא חורגים מ־512 טוקנים.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, ולכן אי אפשר לזרוק עליו דוחות כספיים מלאים, אלא רק כותרות, פסקאות בודדות או משפטים קצרים. בנוסף, המודל אומן על אנגלית בלבד, כך שטקסט בעברית לא יעבוד עליו בכלל. נקודה קריטית נוספת היא סט המבחן, שכלל בסך הכול 485 דוגמאות שמתוכן רק 58 שליליות, מדגם קטן יחסית שדורש בדיקה עם נתונים אמיתיים שלכם לפני שסומכים עליו.

שאלות
נפוצות

האם המודל מבין דיווחי בורסה בעברית?

לא. המודל אומן אך ורק על אנגלית פיננסית. אם תזינו לו טקסט בעברית תקבלו תוצאות חסרות משמעות לחלוטין.

אפשר להעלות אליו קובץ PDF של דוח שנתי מלא?

לא ישירות. המודל מוגבל ל־512 טוקנים, שזה בערך פסקה או שתיים. כדי לנתח דוח מלא, תצטרכו לחתוך אותו למשפטים בנפרד ולהריץ אותם בזה אחר זה.

איך מריצים

טוענים אותו ישירות מתוך ספריית transformers בפייתון דרך pipeline של סיווג טקסט. קבצי המשקולות תופסים רק 419 מגה בייט, כך שאין צורך בכרטיס מסך מפלצתי. כל מחשב פיתוח בסיסי או מעבד רגיל בשרת ענן יריצו אותו בלי למצמץ.

אם יש לכם כמה אלפי משפטים ביום, הריצה המקומית לוקחת שניות ולא דורשת התעסקות עם חיבורי רשת. מנגד, אם כל מה שאתם צריכים זה לסווג כמה עשרות כותרות בודדות פעם בחודש, הקמה של סביבת הרצה עצמאית מיותרת, ועדיף להשתמש בנקודת קצה קיימת ברשת.

from transformers import pipeline

pipe = pipeline("text-classification", model="ahmedrachid/FinancialBERT-Sentiment-Analysis")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 419 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא הגדיר רישיון בעמוד המודל. מבחינה משפטית, כשאין רישיון מפורש אין לכם היתר חוקי להשתמש בו במוצר מסחרי, גם אם הקוד פתוח להורדה. אם אתם בונים שירות לחברה או ללקוחות, קחו בחשבון שיש פה סיכון זכויות יוצרים עד שהיוצר יבהיר את תנאי השימוש.

הרישיון המלא בעמוד המודל ↗