GPT
F

finbert-pretrain

קוד פתוח

yiyanghkustרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • fill-mask
  • endpoints_compatible

בסיס לעיבוד שפה שאימנו ספציפית על דוחות כספיים ושיחות ועידה של אנליסטים. שווה לקחת אותו אם אתם צריכים לאמן מודל משלכם על טקסטים פיננסיים באנגלית במקום להתחיל מברט רגיל.

  • 512טוקנים בהקשר
  • 421 MBמשקל הקבצים
  • 46,220הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל שפת מסכה שמבוסס על ארכיטקטורת BERT עם 12 שכבות, שרץ על חלון הקשר סטנדרטי של 512 טוקנים. במקום הטקסט הכללי של ויקיפדיה, אימנו אותו מראש על קורפוס ייעודי של 4.9 מיליארד טוקנים מעולם שוק ההון. המאגר הזה כולל 2.5 מיליארד טוקנים מדוחות רשמיים לרשות ניירות ערך האמריקאית, 1.3 מיליארד מתמלילי שיחות רווח של חברות, ועוד 1.1 מיליארד מדוחות אנליסטים.

הוא מיועד לשמש כנקודת מוצא להתאמה אישית, ולא כמוצר סופי שפולט תשובות. היתרון הגדול שלו על פני מודלים כלליים באותו גודל הוא ההבנה המוקדמת של הז'רגון התאגידי, מונחי הדיווח והניסוחים היבשים שמופיעים בדוחות 10-K, בלי שתצטרכו לשרוף משאבים על אימון ראשוני מאפס.

מתאים ל

  • אימון לסיווג סנטימנט פיננסי

    בסיס מעולה לכוונון עדין שיזהה נימה חיובית או שלילית בהודעות לעיתונות על רווחי חברות.

  • זיהוי אמירות צופות פני עתיד

    התאמת המודל לחילוץ הצהרות של הנהלה מתוך שיחות רווח ודוחות רבעוניים.

  • חילוץ ישויות מדוחות שנתיים

    שימוש במשקלים המאומנים כדי לאתר שמות חברות, מדדים וסעיפים חשבונאיים בניסוחים כבדים.

איפה זה נופל

זה מודל מסכה, מה שאומר שהוא רק יודע להשלים מילים חסרות בתוך משפט. אי אפשר לזרוק עליו פרומפט ולקבל סיכום, והוא לא יסווג לכם סנטימנט ישר מהקופסה בלי שתאמנו שכבה נוספת מעליו. בנוסף, חלון של 512 טוקנים מגביל מאוד. אי אפשר להזין אליו דוח כספי שלם בבת אחת, ותצטרכו לחתוך את הטקסט לחתיכות קטנות. הוא גם אומן על אנגלית עסקית בלבד, כך שטקסט בעברית לא יעבוד פה בכלל.

שאלות
נפוצות

האם המודל הזה מוכן לשימוש ישיר לזיהוי סנטימנט?

לא. זו גרסת קדם האימון בלבד שמבצעת השלמת מילים. בשביל סנטימנט, סיווג ESG או משימות ספציפיות אחרות צריך לקחת אותו ולעשות לו fine-tuning, או להוריד מודל ייעודי שכבר אומן למשימה הזו.

האם אפשר להריץ עליו מסמכים פיננסיים בעברית?

לא כדאי בכלל. המודל אומן על 4.9 מיליארד טוקנים באנגלית שנלקחו מדוחות אמריקאיים ואנליסטים זרים. אין לו שום ידע מוקדם בעברית או בהתנסחות של דוחות מקרן ההשתלמות הישראלית.

איך מריצים

אתם מריצים אותו מקומית בלי שום בעיה דרך ספריית transformers. הקבצים שוקלים בסך הכל 421 מגה בייט, כך שלא צריך שרת מפלצתי או כרטיס מסך יקר. כל מעבד מודרני ממוצע מריץ אותו במהירות, וכרטיס מסך בסיסי יספיק מעל ומעבר אם תרצו לאמן אותו הלאה על הנתונים שלכם.

אין כאן שום סיבה לשלם לספקי ענן על API חיצוני עבור הגודל הזה. ההורדה מהירה, המשקל קל, והרצה מקומית תיתן לכם שליטה מלאה על הפרטיות, שזה קריטי כשמנתחים חומרים פיננסיים רגישים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="yiyanghkust/finbert-pretrain")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 421 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

החוקרים לא דיווחו על רישיון רשמי בעמוד של המודל. הם מבקשים ציטוט אקדמי למאמרים שלהם, אבל מבחינה משפטית היעדר רישיון מוגדר משאיר את השימוש המסחרי בערפל. אם אתם בונים מוצר מסחרי סגור, עדיף לבדוק מולם את הנושא לפני שאתם משלבים אותו בפרודקשן.

הרישיון המלא בעמוד המודל ↗