GPT
F

finbert-esg-9-categories

קוד פתוח

yiyanghkustרישיון לא דווח2022-10-14

  • transformers
  • pytorch
  • bert
  • text-classification
  • financial-text-analysis

מודל סיווג קל משקל שממפה טקסט פיננסי לתשע קטגוריות ספציפיות של קיימות וממשל תאגידי. הוא מתאים למי שצריך ניתוח עמוק ומדויק יותר מסתם חלוקה כללית לסביבה, חברה וממשל.

  • 512טוקנים בהקשר
  • 419 MBמשקל הקבצים
  • 8,330הורדות בחודש
  • 41לייקים

מה זה

מדובר בהרחבה ממוקדת של FinBERT שעברה אימון ייעודי על כ־14,000 משפטים מתוך דוחות שנתיים ודוחות קיימות של חברות. במקום להסתפק בסיווג רחב לארבעה נושאים כלליים, המודל מפצל את התוכן לתשעה תחומים מוגדרים היטב: משינויי אקלים, זיהום והון אנושי ועד אתיקה עסקית, אחריות מוצר או שלילה מוחלטת של הקשר לתחום.

היתרון שלו על פני מודלים כלליים בגודל הזה נובע מאוצר המילים הפיננסי שעליו הוא נשען מראש. הוא לא מנסה לנחש הקשרים עסקיים מתוך הבנה כללית של השפה, אלא מזהה ביטויים מקצועיים שמשקיעים ואנליסטים מחפשים בדיווחים רשמיים, ומשייך אותם ישירות לתחום הרלוונטי.

מתאים ל

  • סיווג דוחות שנתיים

    פירוק דוחות כספיים באנגלית למשפטים וזיהוי אוטומטי של הצהרות הנוגעות לפליטות, תנאי עובדים וממשל תאגידי.

  • סינון מסמכי השקעה

    מיפוי מהיר של פעילות חברות לפי תשע הקטגוריות כדי לסייע לאנליסטים לבדוק עמידה ברף קיימות מוגדר.

  • בקרת חשיפה רגולטורית

    איתור אזכורים של סיכוני אקלים, זיהום או אתיקה עסקית בטקסטים רשמיים של ספקים ושותפים בינלאומיים.

איפה זה נופל

מגבלת האורך של 512 טוקנים מחייבת לחתוך דוחות ארוכים למשפטים בודדים לפני ששולחים אותם לבדיקה, והוא יודע לנתח רק אנגלית. הכרטיס לא מציג את מדדי הביצועים ישירות בעמוד, ומאגר האימון של 14,000 משפטים ממוקד מאוד בשפה תאגידית פורמלית. אם תזינו לו טקסטים חופשיים מחדשות, רשתות חברתיות או עברית עסקית, הוא עלול לפספס לחלוטין.

שאלות
נפוצות

האם המודל מבין דוחות בעברית?

לא. המודל אומן על אנגלית בלבד ומבוסס על מודל שפה פיננסי באנגלית. הרצה של טקסט בעברית תחזיר שגיאות או תיוגים חסרי משמעות, ואם המידע שלכם בעברית תצטרכו לתרגם אותו בצורה מדויקת לפני הסיווג.

האם אפשר להעביר לו מסמך שלם בבת אחת?

לא, חלון ההקשר שלו נעצר ב־512 טוקנים והוא תוכנן לעבוד ברמת המשפט. תצטרכו לבנות סקריפט שמפרק את המסמך לפסקאות או משפטים, מריץ כל אחד בנפרד ומסכם את התוצאות.

איך מריצים

המודל שוקל 419 מגה בייט בלבד ומבוסס על ארכיטקטורת BERT של 12 שכבות. אפשר להריץ אותו ישירות מתוך ספריית transformers בלי מאמץ, והוא עובד מהר וחלק על מעבד רגיל בכל מחשב פיתוח, בלי צורך בכרטיס מסך ייעודי או בתשתיות כבדות.

במשקל כזה אין שום סיבה לשלם על קריאות ל־API חיצוני או להוציא מידע רגיש לענן. פשוט טוענים את המשקלים למערך המקומי בצינור עיבוד פשוט ומסווגים אלפי משפטים בשניות.

from transformers import pipeline

pipe = pipeline("text-classification", model="yiyanghkust/finbert-esg-9-categories")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 419 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון מוגדר משאיר את זכויות היוצרים בידי החוקרים ויוצר סיכון ממשי לכל מי שרוצה לשלב אותו במוצר מסחרי. לפני שמשלבים אותו בקוד של חברה, חובה לבדוק את תנאי המאמר המקורי או לפנות ישירות ליוצרים לקבלת אישור מפורש.

הרישיון המלא בעמוד המודל ↗