GPT
F

finbert-esg

קוד פתוח

yiyanghkustרישיון לא דווח2022-05-12

  • transformers
  • pytorch
  • bert
  • text-classification
  • financial-text-analysis

מודל סיווג קל משקל שממיין משפטים מדוחות פיננסיים לארבע קטגוריות של קיימות וממשל תאגידי. הוא מתאים למי שרוצה לסנן טקסטים כלכליים במהירות בלי להחזיק מודלי ענק.

  • 512טוקנים בהקשר
  • 419 MBמשקל הקבצים
  • 78,684הורדות בחודש
  • 56לייקים

מה זה

מדובר בהתאמה של FinBERT שמיועדת למשימה אחת מוגדרת: לקבל משפט מתוך דוח שנתי או דוח קיימות, ולקבוע אם הוא שייך לתחום הסביבתי, החברתי, הממשל התאגידי, או שאין לו קשר לנושאים האלה. האימון שלו התבסס על 2,000 משפטים מתויגים ידנית, שזה מאגר קטן יחסית אבל ממוקד בדיוק בשפה של דיווחים עסקיים באנגלית.

בניגוד למודלי שפה כלליים שמנסים לעשות הכול ומחזירים תשובות ארוכות, הוא עובד כסיווג ישיר עם ארבע תוויות בלבד. הוא לא מייצר טקסט חופשי ולא מנתח עומק של חברות, אלא נותן תיוג מהיר לכל משפט כדי שאפשר יהיה להריץ עיבוד כמותי על מסמכים ארוכים.

מתאים ל

  • סיווג משפטים בדוחות שנתיים

    הוא יודע לזהות מיד אם שורה בדוח עוסקת בסביבה, בחברה או בממשל.

  • סינון ראשוני למסמכי ESG

    מאפשר לסנן במהירות רק את המשפטים הרלוונטיים מתוך מאות עמודים באנגלית.

  • איסוף מדדים כמותיים מקבצים

    סופר כמה פעמים חברה התייחסה לכל נושא לאורך הדוחות שלה.

איפה זה נופל

הוא מוגבל למשפטים בודדים עד 512 טוקנים, כך שאי אפשר להזין לו פסקאות ארוכות או דוח שלם בבת אחת בלי לחתוך את הטקסט מראש. המודל אומן על אנגלית בלבד, ודוחות בעברית ידרשו תרגום מקדים שלא תמיד ישמור על המינוח הפיננסי הנכון. מעבר לזה, בסיס האימון כלל 2,000 משפטים בלבד, לכן הוא עלול לפספס ניסוחים פחות שגרתיים או להחזיר None על משפטים מורכבים.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על מסמכים בעברית?

לא. המודל אומן לחלוטין על טקסטים פיננסיים באנגלית. כדי לעבוד עם חברות ישראליות שמדווחות בעברית תצטרכו לתרגם את הטקסט קודם, או לאמן מודל נפרד.

האם הוא יודע לנתח דוחות PDF מלאים?

לא באופן ישיר. המודל מקבל מחרוזת קצרה של טקסט עד 512 טוקנים. אתם תצטרכו לפרק את המסמך למשפטים בודדים, להזין אותם אחד אחד ולחבר את התוצאות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם BertForSequenceClassification וצינור עבודה רגיל לסיווג טקסט. עם משקל של כ־419 מגהבייט ו־12 שכבות, אין שום צורך בחומרה ייעודית כבדה או בשרתי GPU יקרים, והוא רץ בלי בעיה על מעבד רגיל בכל מחשב פיתוח או שרת צנוע.

אין שום הצדקה לשלם לספק ענן על קריאות API חיצוניות עבור מודל כזה. שווה להחזיק אותו מקומית בתוך התשתית שלכם, לעבד איתו קבצים שלמים במכה, ולשמור על הנתונים קרוב לקוד בלי תלות ברשת.

from transformers import pipeline

pipe = pipeline("text-classification", model="yiyanghkust/finbert-esg")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 419 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא פרסמו רישיון שימוש בעמוד המודל. מבחינה משפטית זה אומר שאין אישור מפורש לשימוש מסחרי, ומי שמשלב אותו במוצר פנימי או מסחרי לוקח סיכון של הפרת זכויות יוצרים עד שהמפרסמים יבהירו את הנושא.

הרישיון המלא בעמוד המודל ↗