GPT
F

financial-roberta-large-sentiment

קוד פתוח

soleimanianapache-2.02022-05-16

  • transformers
  • pytorch
  • roberta
  • text-classification
  • Sentiment

המודל הזה מנתח סנטימנט בטקסטים פיננסיים ומחזיר חיובי, שלילי או ניטרלי. הוא מתאים למי שצריך לפענח דוחות כספיים וחדשות באנגלית בלי להסתמך על מודלים כלליים שלא מבינים שפה עסקית.

  • 514טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 37,049הורדות בחודש
  • 58לייקים

מה זה

מדובר בהתאמה ייעודית של RoBERTa-large, שאומנה על קורפוס רחב של דיווחים פיננסיים כמו דוחות עשר קיי ועשר קיו, הודעות על רווחים, תמלילי שיחות משקיעים, דיווחי אחריות תאגידית וחדשות כלכליות. המטרה כאן היא סיווג טקסט לשלוש תוויות בלבד, בלי לנסות לכתוב טקסט חופשי או לתמצת.

ההבדל מול מודלים גנריים בגודל הזה טמון בהבנת המינוח העסקי. בטקסט רגיל, ירידה בהכנסות עשויה להישמע סתמית, אבל בהקשר פיננסי מדובר באיתות שלילי מובהק. היוצר לא פרסם בכרטיס תוצאות מדידה או ציונים רשמיים, כך שאי אפשר לדעת מראש מה רמת הדיוק שלו על נתונים שלא ראה באימון, ותצטרכו לבדוק את הביצועים בעצמכם מול סט נתונים משלכם.

מתאים ל

  • סיווג תמלילי שיחות משקיעים

    המודל אומן על שיחות רווחים ויודע לתפוס נימת דיבור עסקית במשפטים קצרים.

  • סינון חדשות שוק ההון

    הוא מזהה בזמן אמת אם מבזק כלכלי באנגלית נושא אופי חיובי, שלילי או ניטרלי.

  • ניתוח דיווחי ESG

    אימון ייעודי על דוחות סביבתיים ואחריות תאגידית מאפשר להעריך הצהרות חברה.

איפה זה נופל

הבעיה המרכזית היא חלון הקשר קצר של 514 טוקנים. אי אפשר לזרוק אליו דוח כספי שלם, אלא חייבים לחתוך את הטקסט לפסקאות או משפטים מבודדים ולנתח כל חלק בנפרד. בנוסף, המודל אומן על אנגלית בלבד ולא יזהה עברית או מונחים מהבורסה בתל אביב. אין בכרטיס שום נתוני בנצ'מרק, ולכן אי אפשר לדעת איפה הוא נוטה לטעות מול שפה פיננסית עמומה.

שאלות
נפוצות

האם המודל מתאים לניתוח טקסט פיננסי בעברית?

לא. המודל תומך באנגלית בלבד ואומן על מסמכים רגולטוריים של שוק ההון האמריקאי. טקסט בעברית יפיק שגיאות או פלטים חסרי משמעות.

אפשר להזין לתוכו דוח שנתי מלא בבת אחת?

לא, חלון ההקשר מוגבל ל־514 טוקנים בלבד. תצטרכו לפרק את המסמך למשפטים או פסקאות קצרות, להריץ אותם בנפרד ולשקלל את התוצאות.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית transformers בפייתון באמצעות צינור sentiment-analysis פשוט. המשקל הכולל של הקבצים עומד על 1.3 גיגה בייט בדיוק float32, כך שתוכלו להריץ אותו בלי בעיה על מעבד רגיל, אם כי לעיבוד של כמויות טקסט גדולות תרצו מאיץ גרפי בסיסי כדי לא להיתקע.

היוצר שיתף מחברת גוגל קולאב שמאפשרת לחבר קבצים ישירות מגוגל דרייב ולהריץ סיווג בחינם. אם אתם מעבדים כמה מאות פסקאות ביום, הרצה מקומית או בקולאב מספיקה לגמרי, ואין שום צורך לשלם על שירותי ענן יקרים.

from transformers import pipeline

pipe = pipeline("text-classification", model="soleimanian/financial-roberta-large-sentiment")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש במודל לצרכים מסחריים, לשלב אותו בתוך מוצר סגור, לשנות אותו ולהפיץ הלאה. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, והיוצר גם ביקש לתת ציטוט למאמר שלו במידה ומשתמשים בו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗